Thanks for posting the solution. While this is a generic solution it is not applicable to the original question that was posted. Just wanted to make a note of that.
I'm looking for a way to extract the nucleotide sequences of NCBI GenBank records corresponding to specific annotated regions in the associated NCBI GenPept records (either manually, or ideally, programmatically using R package rentrez, FASTA format).
For example, this spike protein sequence has two regions annotated, corresponding to the S1 and S2 glycoproteins, that can be easily highlighted or isolated. But the corresponding nucleotide sequence GenBank entry doesn't feature that annotated region information, giving only the nucleotide sequence of the whole protein. Is there a way of cross-referencing these to only isolate the relevant sequence?
1 answer
This is already a two-year-old question, but I was able to solve the same issue for bacterial sequences using Entrez Direct (the UNIX command line E-utilities).
esearch -db protein -organism bacteria -query "My query" |
efetch -format fasta_cds_na > output.fasta
This worked well enough for me, though I was downloading many sequences and ran into a few "EMPTY RESULT QUERY FAILURE" issues which I have no idea how to solve (maybe these would be GenPept entries with no corresponding Nucleotide links?).
Update: for your exact question, the solution would be:
esearch -db protein -query "QBP43268" |
efetch -format fasta_cds_na
which returns:
>lcl|MG916902.1_cds_QBP43268.1_1 [gene=S] [protein=S protein] [protein_id=QBP43268.1] [location=20437..24495] [gbkey=CDS]
ATGCTTTCTCTTGCAGTTTACTTTGCAGAGTTGCTAGTAATTATATCTTATTTACCAGATTTGGTTACAG
GTGATCTTAATGGCTGTGCTGATGGTCATAATAGGTTACCGAACCTAAATCTAGGTTTGCCACCAAATAG
TACGGTATTTGTTAGTGGTTACCTACCCCGTAAAAATGGGTGGGAGTGCCCAACCATTAACAACCAATAT
GGTGGTTCAACCAACTATGAGAATGTCCATGGTATTTTCTGGTCTTATCATTCTACAGCTCAAAGATTTG
AGTTAGGTGTGTCCAACAAGGACCAGTTGGTGAATACAAACAGATGGGCACTCTACGTTTACCAAAACAA
CAATGAAGGTGTGCTAAAATTACGCATCTGTAAGTGGTTGCGTGGTCAGTACAGCTTACAGTGGTTACAT
GGTGCTAGACATGGGCAGTGTGCAGTAGATAGAGCGTTTAATTTTAGGTTTGTACACGCTGAAAATCAGG
TACTAGGTGTCACTTGGTCCTCTAATTATGTCACTTTTTATGGTATTAATGGTAGTTACCGTTATTACAT
ACCTAATGACTGGTTTAGGGTGTCCGTTAAATGTGAAAATAAGTATGTCTGTGCTATATACCCTGTGTAT
AACCAGACTACCCTCAATATCACAACAAATGCTAAGGGCTTGATTAAGGAATATAGCGTGTGCGAGTCTT
GCAATGGTTTCCCTGCTCATGTCTTCCCAGTTTTGGAAGGTGGTAAAATACCAGCTGACTTTGATTTTAC
TAACTGGTTTTACTTGTCAAACACCTCAACACTTGTTGCTGGTCGTGTTGTCGGCATTCAACCACTTAGA
CTACTCTGTTTATGGCCAGTACCATCTACTACGGCTAATGATGACAAGATTTACTTTAATACAACAGGTG
CTAATTGTAATGGATTTGTTGGTGAAGGCGTTGCAGATGCATTGCGTTTTTCTCTGAACTTCACATCAAA
CCAGGTCCTTAATGGTGTCCATAACATCATTTTGGAAAGCACCTCTTCAAAGTTTACTTTCACGTGCCGT
AATGATTCTGAATCCACCTTTTACAGAGTTCCTTTTGGTGAAACGGGACAAGTCTATTATTGTTTCATTT
TCACAGAGGCAGGCAATCAGAGCTATAACACATTTGTAGGTATTTTACCACCTGTGCTAAAAGAAATCGT
TATTTCTCGCTATGGGTCCATTTATCTAAATGGTGTCAAATTGTTTAGCTTGCCTACTCTTGAAAGTGTC
ATTTTTAACGTCTCTAGTAATGTTGGCTCTGATTTCTGGACCATAGCCTATGCACAAGATGCTCAGGTTA
TGGTGGATCTCAATGCAACTAGCATCACTGATTTGTTGTACTGTGATACACCTTTAAATAGACTTAAGTG
CCAGCAGCTCAGCTATGCCCTAGAAGACGGTTTTTATCCTACTACCAACATATATACTAAGGATATTCCT
AGGTCGTATGTTGCCTTACCTTATCACGCCACACATGCTGTTCTTAATATAACAGCATATATTGGTGACA
AGAAGGATGACCGCATTCAAATCAATGGTTTTAATGACTCTTTTTGTGTGAACACAACACAGTTCACTAC
AAATTTTGTCCAAACAGATTCTGGCATTATTAAAGCTGAGTTGAAAAATGGTGATTGCCCTTTCACCTTT
GACTCAATTAATAATTATTTAACATTTGACTCCATCTGCTTCTCAATTGAGCCTATTGGCGGTGGTTGCA
CAATGAACATAGTCCGCACATGGTTTGGCCAATCTGTACCGTGGAGGACTCTTTACGTGTCTTACACTAA
AGGCTCCAGAATCACAGGTGTCAAAACCCCAAACACTGGCGTGTTTGACCCTAGCACTTTTGTAGAGGAT
GTTTGCACTGACTACACTATCTATGGTATGTCCGGTAGAGGTGTAATTAGTCGTTCTAATGCTTCATACA
TTGCTGGTCTCTATTACACAGCCATTTCGGGACAACTTTTGGGCTTCAAAAATGCAACCACAGGTGAGAC
ATTTGTTGTGGTGCCTTGTGACTTATCTAGCCAGGCTGCAGTCATTGGTGACAAAGTTGTTGGTGTTATG
ACCTCTATTACAAACTCTTCTTTTGAGTTTGTTAAGTCTATTGAAACACCTAACTTTTATTACTTGACCA
ATGCTACAGCTAATTGCACATCGCCCGTTATCACTTATGGTAAGTTGGGTGTTTGTGAGGATGGTTCCAT
TGCTGAAGTCAAGGTTAATACCCATGTGCAAACACCGGTCTCACCTATTTCAACAGGCAATATTACAGTG
CCCTCCAACTTCACAGTTTCTGTGCAGGTCGAATACTTGCAAATGTACATGAGACCGGTCAGTGTAGACT
GTGCTATGTATGTTTGTAATGGCAATCCACATTGTCTACGACTGCTGACACAGTATGCTTCCGCATGCAG
AACAATTGAAGACGCACTACAATTGAGTGCTCGTTTGGAGTCTATTGAGGTCAATAGTGTCATCTCTGTA
TCCGAAGATGCGCTTGAACTGGCCAACATTAGTAACTTTGACCATTACAACATGTCTGCACTGCTGCCAA
AGAAAAATGGGCGCAGTTTCATTGAAGACCTGTTGTTTAACAAAGTTGTTACTAATGGTCTTGGCACAGT
TGACCAAGATTATAAAAAGTGCATGAAAGATAAAGGCTTCGGTGAGGCCTCTGACATTGCGTGTGTACAG
TATTACAACGGCATTATGGTTCTGCCTGGTGTGGTTGATGACAGCAAAATGGCTTTGTACACTGCTGCTT
TGACTGGTGGCATGCTTTTGGCCGCTTTCACTGCTGGAGCTTCTATACCATTTTCCTTGGCTGTCCAATC
TAGACTTAATTATGTAGCCTTGCAAACTGATGTTTTACAGAAGAATCAACAAATTCTGGCAACATCCTTT
AACAATGCTATGAGCAACATTACTGTCGCTTTTACTGAAGTCAACCAGGCTATTAAAGAAACATCTGATG
CCATTAATACTGTTGCTAAGGCCCTTGGCAAAGTTCAATCCGTTGTGAATGAGCAAGGTCAAGCATTGTC
GCAGCTTACACGTCAACTTGCTTCTAATTTTCAGGCTATATCCTCCTCTATAGAGGATATATATAATAGG
TTGGATAGCTTAGCTGCCGATGCCCAAGTAGACAGACTGATTACCGGCAGATTAGGTGCCCTTAATGCAT
TTGTCACACAAACTCTAACTCGCTATACCGACGCACGTGCTTCTCGTCAATTGGCTATTCAGAAGATCAA
TGAGTGTGTGAAATCTCAATCCATGCGTTATGGGTTTTGTGGTAATGGTACACATTTGTTTTCCATTGCT
AATGCTGCACCTAATGGTGTTATGCTGTTCCACACAGTTTTGATCCCTACTGAATTTGTCACTGTTGAGG
CTTGGTCTGGAGTCTGTGTCGATGGTACACATGGTCTCATTTTGCGTGATGTTCGCACTACACTGTTTCA
ACAAGGTAGTACTTATTACGTGACTACACGAGACATGTTTGAACCACGAACACCTGTTGCTGCTGACTTT
GTCCGTATTGCTAATTGTAGTGTGACATACGTCAATATTACTGCTGATTCTCTTGGTGAGATCATTCCAG
ATTACATTGACGTGAATAAAACTCTTGAAGAGTTGGGCAGGCCTAACTTCACACTGCCAGATTTCAACTT
GGATCAGTTCAATAACACATATCTCAACCTTAGTGCTGAGATAGCTCTGTTGAACGCCAAGTCTGAAAGT
CTGTACAACACTACTCAGAGACTTGAGAAATCGATTGAAAACATTAACAATTCTTACATAGACTTGGAGC
TGCTTAATAGGCTTGAATCCTATGTGAAGTGGCCGTGGTATGTCTGGTTGGCAATCTTCCTGGCTTTGAT
ACTGTTTTCATTTCTCATGCTTTATTGTTGTATGGCTACTGGTTGTTGTGGCTGCTGTAGCTGTCTTTCT
AATTCATGCTTTGACTGTGGAGGACGACGTTTACAACGTTACGAAGTAGAAAAAGTCCACATTCAATAA
Thanks. I updated my answer to include the exact command the poster can use for their specific question.
Log in to answer this question.
I don't think you can retrieve the nucleotide sequence just for those regions. They are annotated as
regionsand AFAIK you can only retrieve nucleotide sequence of entire CDS.