Hi,
I have the same problem and the sequences aren't in the same order. May I know what should I do? Thank you.
Ther all I was wondering if anyone could help me in obtaining a concatenamer of sequences in the way showed below. I have several multifasta files relative a genes sequences (ABC, GHJ…) in different organisms (>182680572 , >749299147…)
Gene ABC
>182680572
ATGGAATCTTGGTCCCGTTGCCTGGAACGTCTTGAAACTGAATTTCCACCAGAAGATGTTCATACTTGGTTGAGACCTTTACAAGCTGACCAACGCGGTGACAGTGTCATCCTTTACGCACCCAATACCTTTATCATTGAACTAGTAGAAGAGCGATA
>749299147
ATGACAACATTGATGGAATCTTGGTCCCGTTGCCTGGAACGTCTTGAAACTGAATTTCCACCAGAAGATGTTCATACTTGGTTGAGACCTTTACAAGCTGACCAACGCGGTGACAGTGTCATCCTTTACGCACCCAATACCTTTATCATTGAACTAGTAGAAGAGCGATACTTAGGGCGTCTTCGAGAATTGTTATCCTATTTTTCAGGAATACGTGAAGTAGTCCTTGCAATTGGCA
>584117620
ATGGAATCTTGGTCCCGTTGCCTGGAACGTCTTGAAACTGAATTTCCACCAGAAGATGTTCATACTTGGTTGAGACCTTTACAAGCTGACCAACGCGGTGACAGTGTCATCCTTTACGCACCCAATACCTTTATCATTGAACTAGTAGAAGAGCGATACTTAGGGCGTCTTCGAGAATTGTTATCCTATTTTTCAGGAATACGTGAAGTAGTCCTTGCAATTGGCTCACGACCTAA
>985743106
ATGACAACATTGATGGAATCTTGGTCCCGTTGCCTGGAACGTCTTGAAACTGAATTCCCGCCAGAAGATGTTCATACTTGGTTAAGACCTTTACAAGCCGACCAACGTGGTGACAGTGTCGTCCTTTACGCACCGAATCCCTTTATCATTGAACTAGTAGAAGAGCGATACTTAGGACGTCTTCGGGAATTGTTATCCTATTTTTCAGGAATACGTGAAGTAGTCCTTGCAATTGG
GENE GHJ
>182680572
ATGGAATCTTGGTCCCGTTGCCTGGAACGTCTTGAAACTGAATTTCCACCAGAAGATGTTCATACTTGGTTGAGACCTTTACAAGCTGACCAACGCGGTGACAGTGTCATCCTTTACGCACCCAATACCTTTATCATTGAACTAGTAGAAGAGCGATA
>749299147
ATGACAACATTGATGGAATCTTGGTCCCGTTGCCTGGAACGTCTTGAAACTGAATTTCCACCAGAAGATGTTCATACTTGGTTGAGACCTTTACAAGCTGACCAACGCGGTGACAGTGTCATCCTTTACGCACCCAATACCTTTATCATTGAACTAGTAGAAGAGCGATACTTAGGGCGTCTTCGAGAATTGTTATCCTATTTTTCAGGAATACGTGAAGTAGTCCTTGCAATTGGCA
>584117620
ATGGAATCTTGGTCCCGTTGCCTGGAACGTCTTGAAACTGAATTTCCACCAGAAGATGTTCATACTTGGTTGAGACCTTTACAAGCTGACCAACGCGGTGACAGTGTCATCCTTTACGCACCCAATACCTTTATCATTGAACTAGTAGAAGAGCGATACTTAGGGCGTCTTCGAGAATTGTTATCCTATTTTTCAGGAATACGTGAAGTAGTCCTTGCAATTGGCTCACGACCTAA
>985743106
ATGACAACATTGATGGAATCTTGGTCCCGTTGCCTGGAACGTCTTGAAACTGAATTCCCGCCAGAAGATGTTCATACTTGGTTAAGACCTTTACAAGCCGACCAACGTGGTGACAGTGTCGTCCTTTACGCACCGAATCCCTTTATCATTGAACTAGTAGAAGAGCGATACTTAGGACGTCTTCGGGAATTGTTATCCTATTTTTCAGGAATACGTGAAGTAGTCCTTGCAATTGG
Then I want to obtain for each organism a concatened sequence of the genes in the same order for each organisms
>182680572
ATGGAATCTTGGTCCCGTTGCCTGGAACGTCTTGAAACTGAATTTCCACCAGAAGATGTTCATACTTGGTTGAGACCTTTACAAGCTGACCAACGCGGTGACAGTGTCATCCTTTACGCACCCAATACCTTTATCATTGAACTAGTAGAAGAGCGATAATGGAATCTTGGTCCCGTTGCCTGGAACGTCTTGAAACTGAATTTCCACCAGAAGATGTTCATACTTGGTTGAGACCTTTACAAGCTGACCAACGCGGTGACAGTGTCATCCTTTACGCACCCAATACCTTTATCATTGAACTAGTAGAAGAGCGATA
>749299147
ATGACAACATTGATGGAATCTTGGTCCCGTTGCCTGGAACGTCTTGAAACTGAATTTCCACCAGAAGATGTTCATACTTGGTTGAGACCTTTACAAGCTGACCAACGCGGTGACAGTGTCATCCTTTACGCACCCAATACCTTTATCATTGAACTAGTAGAAGAGCGATACTTAGGGCGTCTTCGAGAATTGTTATCCTATTTTTCAGGAATACGTGAAGTAGTCCTTGCAATTGGCAATGACAACATTGATGGAATCTTGGTCCCGTTGCCTGGAACGTCTTGAAACTGAATTTCCACCAGAAGATGTTCATACTTGGTTGAGACCTTTACAAGCTGACCAACGCGGTGACAGTGTCATCCTTTACGCACCCAATACCTTTATCATTGAACTAGTAGAAGAGCGATACTTAGGGCGTCTTCGAGAATTGTTATCCTATTTTTCAGGAATACGTGAAGTAGTCCTTGCAATTGGCA
>584117620
ATGGAATCTTGGTCCCGTTGCCTGGAACGTCTTGAAACTGAATTTCCACCAGAAGATGTTCATACTTGGTTGAGACCTTTACAAGCTGACCAACGCGGTGACAGTGTCATCCTTTACGCACCCAATACCTTTATCATTGAACTAGTAGAAGAGCGATACTTAGGGCGTCTTCGAGAATTGTTATCCTATTTTTCAGGAATACGTGAAGTAGTCCTTGCAATTGGCTCACGACCTAA ATGGAATCTTGGTCCCGTTGCCTGGAACGTCTTGAAACTGAATTTCCACCAGAAGATGTTCATACTTGGTTGAGACCTTTACAAGCTGACCAACGCGGTGACAGTGTCATCCTTTACGCACCCAATACCTTTATCATTGAACTAGTAGAAGAGCGATACTTAGGGCGTCTTCGAGAATTGTTATCCTATTTTTCAGGAATACGTGAAGTAGTCCTTGCAATTGGCTCACGACCTAA
>985743106
ATGACAACATTGATGGAATCTTGGTCCCGTTGCCTGGAACGTCTTGAAACTGAATTCCCGCCAGAAGATGTTCATACTTGGTTAAGACCTTTACAAGCCGACCAACGTGGTGACAGTGTCGTCCTTTACGCACCGAATCCCTTTATCATTGAACTAGTAGAAGAGCGATACTTAGGACGTCTTCGGGAATTGTTATCCTATTTTTCAGGAATACGTGAAGTAGTCCTTGCAATTGGATGACAACATTGATGGAATCTTGGTCCCGTTGCCTGGAACGTCTTGAAACTGAATTCCCGCCAGAAGATGTTCATACTTGGTTAAGACCTTTACAAGCCGACCAACGTGGTGACAGTGTCGTCCTTTACGCACCGAATCCCTTTATCATTGAACTAGTAGAAGAGCGATACTTAGGACGTCTTCGGGAATTGTTATCCTATTTTTCAGGAATACGTGAAGTAGTCCTTGCAATTGG
Does anyone knows how to do it with a perl/python script or bioinformatic software?
https://bioinf.shenwei.me/seqkit/usage/#concat
seqkit concat *.fasta > result.fa
Assuming you have all the sequences in the same order in multiple files, you can probably do something like:
paste file1 file2 file3 | sed 's/\t>.*//g' | tr -d '\t' > concat.fa
The "sed" part is used for removing the fasta headers after the first tab generated by the paste command and "tr" is used to remove the tabs.
However if the sequences aren't in the same order then you'll have to do some file manipulation.
Hi,
I have the same problem and the sequences aren't in the same order. May I know what should I do? Thank you.
Just try seqkit ... The orders do not matter.
Thanks, but the ID are different for each file:
File A: > My_bacteriaA_geneA
atgatg
> My_bacteriaB_geneA
atgatg
> My_bacteriaC_geneA
atgatg
File B:
> My_bacteriaB_geneB
atgatg
> My_bacteriaC_geneB
atgatg
> My_bacteriaA_geneB
atgatg
May I know what should I do? Thank you.
I like seqkit. But here also an awk solution:
$ cat *.fa|awk -v RS=">" -v FS="\n" -v OFS="\n" '$0 {seq[$1] = seq[$1]$2}; END {for(id in seq){print ">"id, seq[id]}}'
fin swimmer
Hi, may I know can this awk script be apply in my case, where the sequence ID slightly different?
Log in to answer this question.
Hello,
how is the order of the sequence files that should be concatenate determined? Sorted by filename? Manual order?
Why do you like to do this?
fin swimmer
It depends on the user.
Yes, I know. But I'm not sure whether the OP knows that. That's because I'm asking.