This is a test version of Biostars. For the public version, visit https://www.biostars.org.
From .csv file to fasta

Hi,

I want to convert this csv file in fasta format in order to have the name in the first row that maches the sequence in the second.

This is how the csv file looks:

kmer_100410623.0    AGTTTCTAGGCTTACAGGATGAAGA
kmer_100410669.0    AGTTTCTAGGCTTTAAGGATGAAGA
kmer_100423637.0    AGTTTCTGGGCTTTCAGGATGAAGA
kmer_100425211.0    AGTTTCTGTGCATTTGGAATGAAGA
kmer_100427622.0    AGTTTCTTAGCTTTCAGGATGAAGA
kmer_100432807.0    AGTTTCTTGGCTTTCATAATGAAGA
kmer_100433939.0    AGTTTCTTTACATTTGGAATGAAGA

The output should be like this

>kmer_100410623.0
AGTTTCTAGGCTTACAGGATGAAGA
>kmer_100410669.0
AGTTTCTAGGCTTTAAGGATGAAGA
>kmer_100423637.0   
AGTTTCTGGGCTTTCAGGATGAAGA

and so on...

Any suggestion of how to do it using python/bash or R ?

Thanks

fasta python genome assembly kmer

1 answer

BTW: Your example looks like a tab or space separated, rather than a , separated file.

$ more example
kmer_100410623.0,AGTTTCTAGGCTTACAGGATGAAGA
kmer_100410669.0,AGTTTCTAGGCTTTAAGGATGAAGA
kmer_100423637.0,AGTTTCTGGGCTTTCAGGATGAAGA
kmer_100425211.0,AGTTTCTGTGCATTTGGAATGAAGA
kmer_100427622.0,AGTTTCTTAGCTTTCAGGATGAAGA
kmer_100432807.0,AGTTTCTTGGCTTTCATAATGAAGA
kmer_100433939.0,AGTTTCTTTACATTTGGAATGAAGA

$ cat example | tr "," "\n" | sed 's/^kmer/>kmer/'
>kmer_100410623.0
AGTTTCTAGGCTTACAGGATGAAGA
>kmer_100410669.0
AGTTTCTAGGCTTTAAGGATGAAGA
>kmer_100423637.0
AGTTTCTGGGCTTTCAGGATGAAGA
>kmer_100425211.0
AGTTTCTGTGCATTTGGAATGAAGA
>kmer_100427622.0
AGTTTCTTAGCTTTCAGGATGAAGA
>kmer_100432807.0
AGTTTCTTGGCTTTCATAATGAAGA
>kmer_100433939.0
AGTTTCTTTACATTTGGAATGAAGA

Log in to answer this question.