Hi! Thank you for your response!
I successfully extracted the gene information for my gene of interest NP_001182684.1:
mRNA transcript variant 2 NM_001195755.2, 3 exons, total annotated spliced exon length: 3605
protein isoform GPR120-S NP_001182684.1 (CCDS55720.1), 3 coding exons, annotated AA length: 361
Exon table for mRNA NM_001195755.2 and protein NP_001182684.1
Genomic Interval Exon Genomic Interval Coding Gene Interval Exon Gene Interval Coding Exon Length Coding Length Intron Length
------------------------------------------------------------------------------------------------------------------------------------------------------------------------------
93566665-93567287 93566721-93567287 1-623 57-623 623 567 8803
93576091-93576219 93576091-93576219 9427-9555 9427-9555 129 129 11000
93587220-93590072 93587220-93587609 20556-23408 20556-20945 2853 390
But I have a few concerns. In the CCDS database CCDS55720.1, the CCDS sequence data section shows the exact sequence I want.
Nucleotide Sequence (1086 nt):
ATGTCCCCTGAATGCGCGCGGGCAGCGGGCGACGCGCCCTTGCGCAGCCTGGAGCAAGCCAACCGCACCC
GCTTTCCCTTCTTCTCCGACGTCAAGGGCGACCACCGGCTGGTGCTGGCCGCGGTGGAGACAACCGTGCT
GGTGCTCATCTTTGCAGTGTCGCTGCTGGGCAACGTGTGCGCCCTGGTGCTGGTGGCGCGCCGACGACGC
CGCGGCGCGACTGCCTGCCTGGTACTCAACCTCTTCTGCGCGGACCTGCTCTTCATCAGCGCTATCCCTC
TGGTGCTGGCCGTGCGCTGGACTGAGGCCTGGCTGCTGGGCCCCGTTGCCTGCCACCTGCTCTTCTACGT
GATGACCCTGAGCGGCAGCGTCACCATCCTCACGCTGGCCGCGGTCAGCCTGGAGCGCATGGTGTGCATC
GTGCACCTGCAGCGCGGCGTGCGGGGTCCTGGGCGGCGGGCGCGGGCAGTGCTGCTGGCGCTCATCTGGG
GCTATTCGGCGGTCGCCGCTCTGCCTCTCTGCGTCTTCTTCCGAGTCGTCCCGCAACGGCTCCCCGGCGC
CGACCAGGAAATTTCGATTTGCACACTGATTTGGCCCACCATTCCTGGAGAGATCTCGTGGGATGTCTCT
TTTGTTACTTTGAACTTCTTGGTGCCAGGACTGGTCATTGTGATCAGTTACTCCAAAATTTTACAGATCA
CAAAGGCATCAAGGAAGAGGCTCACGGTAAGCCTGGCCTACTCGGAGAGCCACCAGATCCGCGTGTCCCA
GCAGGACTTCCGGCTCTTCCGCACCCTCTTCCTCCTCATGGTCTCCTTCTTCATCATGTGGAGCCCCATC
ATCATCACCATCCTCCTCATCCTGATCCAGAACTTCAAGCAAGACCTGGTCATCTGGCCGTCCCTCTTCT
TCTGGGTGGTGGCCTTCACATTTGCTAATTCAGCCCTAAACCCCATCCTCTACAACATGACACTGTGCAG
GAATGAGTGGAAGAAAATTTTTTGCTGCTTCTGGTTCCCAGAAAAGGGAGCCATTTTAACAGACACATCT
GTCAAAAGAAATGACTTGTCGATTATTTCTGGCTAA
Translation (361 aa):
MSPECARAAGDAPLRSLEQANRTRFPFFSDVKGDHRLVLAAVETTVLVLIFAVSLLGNVCALVLVARRRR
RGATACLVLNLFCADLLFISAIPLVLAVRWTEAWLLGPVACHLLFYVMTLSGSVTILTLAAVSLERMVCI
VHLQRGVRGPGRRARAVLLALIWGYSAVAALPLCVFFRVVPQRLPGADQEISICTLIWPTIPGEISWDVS
FVTLNFLVPGLVIVISYSKILQITKASRKRLTVSLAYSESHQIRVSQQDFRLFRTLFLLMVSFFIMWSPI
IITILLILIQNFKQDLVIWPSLFFWVVAFTFANSALNPILYNMTLCRNEWKKIFCCFWFPEKGAILTDTS
VKRNDLSIISG
However, using any of the provided coordinates results in a truncated nucleotide FASTA sequence.
When I extracted the sequence from chr10:93566721-93587609 as given:
Chromosome Start Stop
10 93566721 93567287
10 93576091 93576219
10 93587220 93587609
I obtained the correct sequence, but there is a long intervening sequence in the middle. How can I extract just the coding sequence (CDS) as shown in the CCDS sequence data section directly?
Samtools simply isn't designed for this sort of thing. The use of fasta is primarily for purposes of supplying a reference sequence, not for general purpose genome analysis.
You're better off doing a query against GenBank or EMBL databases and directly pulling out the gene data from that, or using the various genome browsers like Ensembl or UCSC. (I see others have already covered these options far better than I could.)