This is a test version of Biostars. For the public version, visit https://www.biostars.org.
help with file processing

Hi all,

I have a fasta file with sequences as below

>ATGATCTATCGTGTATCACGGTCA(1) TGACCGTGATACACGATAGATCAT
>TACGGTTCTGAAACGGAGAGTTCG(1) CGAACTCTCCGTTTCAGAACCGTA
>GCTTGCGACGACTGAGTTGGAG(1) GCTTGCGACGACTGAGTTGGAG
>ATTACTTGTTGTGATTGTTGGCCT(1) ATTACTTGTTGTGATTGTTGGCCT
>ATGCCGTCGGAAATAATGAGTTTA(1) ATGCCGTCGGAAATAATGAGTTTA
>AACAGATCCGCTGTAGCACATCGG(1) CCGATGTGCTACAGCGGATCTGTT
>TTGGCACGAGTGACTCCTTAGAC(1) GTCTAAGGAGTCACTCGTGCCAA
>TTAAGCATGACTTAGACTATC(2) TTAAGCATGACTTAGACTATC
>CAAAGGAACCGTGAGCTCAACT(1) CAAAGGAACCGTGAGCTCAACT

i need an output as below

>AAGTATGATTGATAATTCGTGATT(1) 
    AATCACGAATTATCAATCATACTT
>ATGGATGAAATGACATGGAATACAC(2) 
    GTGTATTCCATGTCATTTCATCCAT
>CATGGATAAGAGAGAAAAGGACACAAGAAGCCA(1) 
    CATGGATAAGAGAGAAAAGGACACAAGAAGCCA
>ATCGGTTGCAGGTAGACCGAGCTT(1) 
    AAGCTCGGTCTACCTGCAACCGAT

can you please suggest me an easiest way to do this or any code in ubuntu

sequence ubuntu

Please use the formatting bar (especially the code option) to present your post better.
code_formatting

Thank you!

With the code button your input will look like this.

>ATGATCTATCGTGTATCACGGTCA(1) TGACCGTGATACACGATAGATCAT
>TACGGTTCTGAAACGGAGAGTTCG(1) CGAACTCTCCGTTTCAGAACCGTA
>GCTTGCGACGACTGAGTTGGAG(1) GCTTGCGACGACTGAGTTGGAG
>ATTACTTGTTGTGATTGTTGGCCT(1) ATTACTTGTTGTGATTGTTGGCCT
>ATGCCGTCGGAAATAATGAGTTTA(1) ATGCCGTCGGAAATAATGAGTTTA
>AACAGATCCGCTGTAGCACATCGG(1) CCGATGTGCTACAGCGGATCTGTT
>TTGGCACGAGTGACTCCTTAGAC(1) GTCTAAGGAGTCACTCGTGCCAA
>TTAAGCATGACTTAGACTATC(2) TTAAGCATGACTTAGACTATC
>CAAAGGAACCGTGAGCTCAACT(1) CAAAGGAACCGTGAGCTCAACT

try

$ sed 's/\s\+/\n/' test.txt or $awk '{print $1"\n"$2}' test.txt

>ATGATCTATCGTGTATCACGGTCA(1)
TGACCGTGATACACGATAGATCAT
>TACGGTTCTGAAACGGAGAGTTCG(1)
CGAACTCTCCGTTTCAGAACCGTA
>GCTTGCGACGACTGAGTTGGAG(1)
GCTTGCGACGACTGAGTTGGAG
>ATTACTTGTTGTGATTGTTGGCCT(1)
ATTACTTGTTGTGATTGTTGGCCT
>ATGCCGTCGGAAATAATGAGTTTA(1)
ATGCCGTCGGAAATAATGAGTTTA
>AACAGATCCGCTGTAGCACATCGG(1)
CCGATGTGCTACAGCGGATCTGTT
>TTGGCACGAGTGACTCCTTAGAC(1)
GTCTAAGGAGTCACTCGTGCCAA
>TTAAGCATGACTTAGACTATC(2)
TTAAGCATGACTTAGACTATC
>CAAAGGAACCGTGAGCTCAACT(1)
CAAAGGAACCGTGAGCTCAACT

1 answer

It could be as simple as:

$ cat your_file | tr " " "\n"
>ATGATCTATCGTGTATCACGGTCA(1)
TGACCGTGATACACGATAGATCAT
>TACGGTTCTGAAACGGAGAGTTCG(1)
CGAACTCTCCGTTTCAGAACCGTA
>GCTTGCGACGACTGAGTTGGAG(1)
GCTTGCGACGACTGAGTTGGAG
>ATTACTTGTTGTGATTGTTGGCCT(1)
ATTACTTGTTGTGATTGTTGGCCT
>ATGCCGTCGGAAATAATGAGTTTA(1)
ATGCCGTCGGAAATAATGAGTTTA
>AACAGATCCGCTGTAGCACATCGG(1)
CCGATGTGCTACAGCGGATCTGTT
>TTGGCACGAGTGACTCCTTAGAC(1)
GTCTAAGGAGTCACTCGTGCCAA
>TTAAGCATGACTTAGACTATC(2)
TTAAGCATGACTTAGACTATC
>CAAAGGAACCGTGAGCTCAACT(1)
CAAAGGAACCGTGAGCTCAACT

Log in to answer this question.