This is a test version of Biostars. For the public version, visit https://www.biostars.org.
Script To Calculate Total No of Genes in FASTA File
>GU294484.1 Hepatitis C virus isolate PK-1, complete genome
ACCTGCCTCTTACGAGGCGACACTCCACCATGGATCACTCCCCTGTGAGGAACTACTGTCTTCACGCAGAAAGCGTCTAGCCATGGCGTTAGTATGAGTGTCGTGCAGCCTCCAGGACCCCCCCTCCCGGGAGAGCCATAGTGGTCTGCGGAACCGGTGAGTACACCGGAATTGCCAGGACGACCGGGTCCTTTCTTGGATAAACCCGCTCAATGCCTGGAGATTTGGGCGTGCCCCCGCAAGACTGCTAGCCGAGTAGTGTTGGGTCGCGAAAGGCCTTGTGGTACTGCCTGATAGGGTGCTTGCGAGTGCCCCGGGAGGTCTCGTAGACCGTGCAACATGAGCACACTTCCTAAACCTCAAAGAAAAACCAAAAGAAAACCCATCCGTCGCCCACAGGACGTCAAGTTCCCGGGTGGCGGACAGATCGTTGGTGGAGTATACGTGTTGCCGCGCAGGGGCCCACGATTGGGTGTGCGCGCGACGCGTAAGGCTTCTGAACGGTCACAGCCTCGCGAACGACGACAGCCTATCCCCAAGGCGCGTCGGAGCGAAGGCCGGTCCTGGGCTCAGCCTGGGTACCCTTGGCCCCTCTATGGTAATGAGGGCTGCGGGTGGGCAGGGTGGCTCCTGTCCCCCCGCGGCTCCCGTCCATCTTGGGGCCCAAACGACCCCCGGCGAAGATCCCGCAACTTGGGTAAAGTCATCGATACCCTTACGTGCGGATTCGCCGACCTCATGGGGTACATCCCGCTCGTCGGCGCTCCCGTAGGAGGCGTCGCAAGAGCCCTCGCGCATGGCGTGAGGGCCCTTGAAGACGGGATAAATTTTGCGACAGGGAACTTGCCCGGTTGCTCCTTTTCTATCTTCCTTCTTGCTCTACTCTCTTGCTTAATTCATCCAGCAGCCAGTCTAGAGTGGCGGAATACGTCTGGTCTCTATGTCCTTACCAACGCCCGTTCCAACAGCAGTATAGTGTACGAGGCCGACGACGTTATCCTGCACACACCCGGCTGTATACCTTGTGTTCAGACCGGCAACACATCCAAGTGCTGGACCCCAATGACACCCACGGTGGCAGTTAAGTATGTCGGAGCAACCACCGCTTCGATACGCGGTCATGTGGACCTGTTAGTGGGCGCAGCCACGATGTGTTCTGCGCTCTACGTGGGTGATGTGTGCGGAGCCGTCTTCCTCGTGGGGCAAGCCTTCACGTTCAGGCCGCGACGCCATCAAACGGTCCAGACCTGCAACTGCTCGCTGTACCCAGGCCATCTCACAGGACATCGAATGGCTTGGGATATGATGATGAACTGGTCCCCTGCTGTTGGCATGGTGGTGGCGCACATCTTACGCCTACCCCAGACCCTGTTTGATATAATAGCCGGGGCCCATTGGGGCGTCTTGGCGGGTCTAGCCTACTATACCATGCAGGGCAACTGGGCCAAGGTCGCAATCATCATGGTTATGTTCTCAGGGGTCGATGCCGTTACGTACATCACTGGGGGCACTGCAGCTCGTGGGGGCCAAGGGCTGGCTAGCCTAATCGTCCGGGGGCCTGAGCAGCGCCTGGAGCTGATCAACACCCATGGCTCGTGGCACATCAACAGTACTGTCCTCCACTGCAATGAGTCCATAAACACAGGGTTTATAGCTGGGTTGTTTTATTATCATAAGTTCAACTTACTGGATGTCCCGAAGGCTCAGCAGCTGCAAGCCCATCACTTTCTTCAGGCAGGGGTGGGGCCCCTTGACAGATGCCAACATCCACCGGCCCTTCTGATGACAACCGTACTGCTGGCATACGCACCTAGACCTTGTGACAGCGTAAAGCAGCACGTGTCTCCGGTCCTGTGTATGCTTCCACACCATCGCCCAGTGGTGGTAGGCACTACTGATCCTAAGGGCGCTCCCACCTATAACTGGGGCGAGAATGAGACAGACGTGTTCCTGCTGAATCCCTGCGGCCTCCTAGTGGTCGGTGGTTTGGGTGGCACGTGGGAGGAACTCCACCGGGGTTTGTCAAGACGTGCGGAGGTTCCCCCTTGTGACATCTATGGGGGTGGGGGGGAGATCCACCAATGGTTCAGACCTCTTCTGCCCCACCGACTGCTTCAGGAAACATCCCGAGGCCACATACAGCCGGTGCGGCTCGGGGCCCTGGTTGACACCTCGATGCATGGTCGACTATCCATACCGGCTTTGGCATTACCCATGTACAGTCAATTTTACACTGTTCAAGGTGAGGATGTTTGTGGGTGGGTTTGGCATCGGTTTACCGCCGCTTGCAACTGGACTAGGGGGGAGCGCTGCGATATCGAGGATCGTGACCGCAGCGAGCAACATCCCCTGCTGCATTCAACAACTGAGCTTGCCATACTGCCTTGCTCTTTCACGCCCATGCCCGCATTGTCAACAGGGTTAATACACCTCCACCAAAACATCGTGGATGTCCAATACCTTTATGGCGTTGGATCTGGCATGGTGGGATGGGCGTTGAAATGGGAATTTGTCATCCTCGTTTTCCTCCTCCTAGCAGATGCACGCGTGTGCGTTGCCCTTTGGCTGATGCTGATGATATCACAAGCAGAAGCAGCCTGGAGAACTTGTCACGCTGAACGCCGTCTCTGCTGCCGGGACACATGGTATCGGCTGGTACCTGGTAGCATTTTGCGCGGCGTGGTACGTGCGGGGAAACTCGTCCCGCTGGTGACCTACAGCCTGACGGGTCTTTGGTCCCTAGCATTGCTCGTCCTTCTACTCCCCCAGCGGGCGTATGCTTGGTCGGGTGAAGACAGTGCCACCCTCGGCGCTGGGATCTTGGTCCTCTTCGGCTTCTTTACCCTGTCACCTTGGTATAAGCACTGGATCAGCCGCCTCATGTGGTGGAACCAGTACGCCATATGTAGGTGTGAGTCTGCTCTCCAAGTATGGGTCCCCCCCCTACTTGCCCGCGGGAGTAGGGACGGTGTTATCCTGCTAACAAGCCTGCTTTATCCATCATTAGTTTTTGACATCGCTAAGCTGCTGATAGCCGTAATAGGCCCATTATATCTAATACAGGCCGCCATCACTACTACCCCCTACTTTGTGCGTGCGCATGTTCTGGTCCGCCTTTGCATGTTCGTGCGCTCCGTGACGGGGGGAAAGTACTTCCAGATGGCCATACTGAGCGTCGGCAGATGGTTTAACACCTACCTATATGACCACCTTGCACCGATGCAACACTGGGCCGCAGCAGGCCTCAAAGACCTGGCAGTAGCCACTGAACCTGTAATATTCAGTCCCATGGAAATCAAGGTCATCACTTGGGGCGCGGACACGGCAGCTTGCGGAGATATCCTATGCGGGCTGCCCGTCTCTGCACGATTAGGCCGTGAGGTGTTGTTGGGACCTGCTGATGACTATCGGGAGATGGGCTGGCGTCTGTTGGCCCCGATTACAGCATACGCCCAGCAAACTAGGCGTCTTTTTGGGACTATTGTGACCAGCTTGACTGGCAGGGACAAGAACGTGGTGGCCGGCGAAGTGCAGGTGCTTTCTACGGCTACCCAGACCTTCCTAGGTACAACATTGGGAGGGGTTATGTGGACTGTTTACCATGGAGCAGGTTCGAGAACACTTGCGGGCGTCAAACATCCTGCGCTCCAAATGTACACAAATGTAGATCAGGACCTCGTTGGATGGCCAGCTCCTCCGGGGGCTAAGTCTCTTGAACCGTGCACCTGCGGGTCTGCGGACTTGTACTTGGTTACCCGCGAAGCTGATGTCATCCCTGCTAGACGCAGGGGGGACTCCACAGCGAGCTTGCTCAGTCCTAGGCCTCTCGCCTGTCTCAAAGGTTCCTCTGGAGGTCCTGTTATGTGCCCTTCGGGCCACGTAGCGGGGATCTTTAGGGCTGCTGTGTGCACCAGAGGTGTAGCAAAAGCCCTACAGTTCATACCAGTGGAAACCCTTAGCACACAGGCTAGGTCTCCATCCTTTTCTGACAATTCAACTCCTCCTGCTGTTCCACAGAGCTATCAAGTAGGGTACCTTCATGCCCCGACCGGCAGCGGTAAGAGCACAAAGGTCCCGGCCGCTTATGTAGCACAAGGATATAATGTTCTCGTGTTGAATCCATCAGTGGCGGCCACACTAGGCTTCGGCTCTTTCATGTCGCGAGCTTATGGGATCGACCCCAACATCCGCACCGGGAACGGCACGGTTACAACTGGTGCTAATCTGACCTATTCCACCTATGGTAAGTTTCTCGCGGACGGGGGTTGCTCGGGGGGAGCATATGATGTGATTATCTGTGATGAGTGTCATGCCCAAGACTCTACTAGCATACTGGGTATAGGCACGGTCCTAGATCAGGCTGAAACGGCTGGGGTGAGGCTGACGGTTTTAGCAACAGCAACTCCCCCAGGCAGCATCATTGGGCCCCATTCTAACCTCAAAGAAGTGGCCCTTGGTTCTGAGGGGGAGATCCCTTTCTTCGGCAAGGCCATACCGCTAGCCCTGCTAAGGGGGAAAGGCACCTTATTTTTTTCCATTCCAAGAAAAAATGTGATGAGATGGCATCCAAACTCAGAGGCATGGGGCTCAACGCTGAAGGAGTACTACAGGGGTCTTGATGTGTCCGTCATACCAACATCAGGAGACGTTGTAGTTTGCGCTACTGACGCCCTCATGACTGGATTCACCGGAGACTTCGACTCTGTCATAGATTGCAACGTGGCTGTTGAACAGTACGTTGATTTCAGCTTGGACCCCACCTTTTCCATTGAGACTCGCACTGCTCCCCAAGACGCGGTTTCCCGCAGTCAACGTCGTGGCCGTACGGGCCGAGGTAGACTCGGCACGTACCGATATGTCACCCCCGGTGAAAGACCGTCTGGGATGTTTGACTCGGCTGTTCTCTGTGAGTGCTATGACGCGGGCTGCTCGTGGTACGACTTGCAGCCCGCCGAGACCACAGTCAGACTAAGAGCTTACTTGTCCACGCCGGGGTTACCTGTCTGCCAAGACCACTTGGAATTTTGGGAGAGCGTCTTCACTGGACTAACTCACATAGATGCCCACTTTCTATCACAGACCAAGCAGCAGGGACTCAACTTCCCATACCTAGCTGCCTACCAAGCCACTGTGTGCGCTCGCGCGCAAGCTCCTCCCCCAAGTTGGGACGAGACATGGAAGTGTCTCGTGCGGCTTAAGCCAACACTACATGGACCTACACCCCTTCGATATCGGCCGGGGCCTGTCCAAAATGAAACCTGCTTGACACACCCCATCACAAAATACCTCATGGCATGCATGTCAGCCGATCTGGAAGTAACCACCAGCACCTGGAGCACCTGGGTGTTGCTCGGAGGGGTCCTCGCGGCCCTGGCAGCCTACTGCTTGTCGGTCGGCTGCGTAGTCATTGTGGGCCACATTGAGCTGGGGGGCAAGCCGGCGCTCGTTCCTGACAAAGAAGTGTTGTATCAACAATACGATGAGATGGAGGAGTGCTCACAAGCTGCCCCATATATCGAACAAGCTCAAGTAATAGCCCACCAGTTCAAGGAAAAAGTCCTTGGATTGCTACAGCGAGCTACCCAACAACAAGCTGTCATTGAGCCCATAGTAGTTACCAACTGGCAAAAGCTTGAGGCCTTCTGGCACAAGCACATGTGGAACTTTGTGAGTGGGATTCAGTACCTAGCAGGTCTCTCCACTTTGCCCGGCAACCCCGCTGTGGCGTCTCTTATGGCGTTCGCTGCTTCAGTCACCAGTCCCCTGACGACCAATCAAACTATGTTTTTTAACATACTCGGGGGATGGGTTGCTACTCATTTGGCAGGGCCCCAGAGCTCTTCCGCATTCGTGGTAAGCGGCTTGGCCGGCGCTGCCATAGGGGGCATAGGCCTGGGCAGGGTCTTACTTGACATCCTGGCAGGATACGGAGCTGGTGTCTCAGGCGCCTTGGTGGCTTTCAAAATCATGGGGGGGGAACTCCCCAATGCCGAGGACGTGGTCAATCTGTTGCCCGCCATACTATCTCCGGGTGCTCTCGTCGTCGGGGTGATATGCGCTGCCCTACTACGTCGGCACGTGGGACCTGGGGAGGGAGCGGTACAGTGGATGAACAGGCTCATCGCGTTCGCATCCCGGGGCAACCACGTCTCACCGACGCACTATGTTCCCGAGAGCGATGCTGCGGCAAGGGTCACCGCATTGCTGAGTTCTCTAACTGTCACAAGTCTGCTCCGGCGGTTACACCAGTGGATCAATGAAGACTACCCAAGCCCTTGTAGCGACGATTGGCTACGTACCATCTGGGACTGGGTCTGCATGGTGTTGCTCGACTTCAAGACATGGCTGTCTGCTAAGATCATGCCATTGCTCCCTGGGTTGCCCTTCATTTCCTGTCAAAAGGGATATAAGGGCGTTTGGCAGGGGGACGGCGTGGTGTCCACTCGCTGTCCTTGCGGAGCAGTGATAACCGGTCATGTGAAGAACGGGTCCATGCGGCTTGCAGGACCACGTACATGTGCTAACATGTGGCACGGCACCTTCCCCATCAACGAGTACACCACCGGACCCAGCACACCTTGCCCATCACCCAACTACACTCGTGCACTGTGGCGCGTGGCTGCCAACAGCTACGTCGAAGTGCGACGGGTGGGAGACTTCCACTACATCACGGGGGCCACAGAAGATGAGCTCAAGTGTCCGTGCCAAGTGCCGGCTGCTGAGTTCTTTACTGAAGTGGATGGGGTGAGACTTCACCGTTACGCCCCTCCATGCAGGCCCCTGTTGAGGGATGAGATCACTTTCGTAGTAGGGCTGAATTCTTACGCGATAGGATCCCAACTCCCTTGTGAGCCCGAACCGGACGTCTCTGTGCTGACCTCGATGTTGAGAGACCCTTCCCATATCACCGCCGAGACGGCAGCGCGCCGCCTTGCACGCGGGTCCCCTCCATCAGAGGCAAGCTCATCCGCCAGTCAACTATCGGCTCCATCGTTGAAGGCCACTTGCCAAACGCATAGGCCTCATCCCGACGCGAGCTGGTGGACGCCAACTTGTGTTTGGCGACAAGAGATGGGCAGCAACATCACACGGGTAGAGTCCGAAACAAAGGTTGTGATTCTTGACTCATTCGAACCTCTGAGGGCCGAGACTGATGACACCGAGCTCTCGGTAGCAGCAGAGTGTTTCAAGAAACCTCCCAAGTATCCTCCAGCCCTCCCTATCTGGGCTAGGCCAGACTACAACCCTCCACTGTTGGATCGTTGGAAATCACCGGATTATGAACCACCAATTGTTCATGGGTGCGCCTTACCACCACAGGGTACTCCACCGGTGCCTCCCCCTCGGAGGAAAAGAACAATCCAGCTGGACGGCTCCAATGTGTCCGCGGCGCTAGCTGCGCTAGCGGAAAAATCATTCCCGGCCTCAAAACCGTTGGAAGCGGGTAGCTCATCCTCAGGGGTCGATACACAGTCCAGCACTACTTCCAAGGTGCCTCCCTCTTCGGAGAGAGAGTCCGACACAGAATCGTGCTCGTCCATGCCTCCTCTCGAGGGGGAGCCGGGCGATCCAGACTTGAGTTGCGACTCTTGGTCCACTGTTAGTGACAGCGAGGAGCAGAGCGTGGTCTGCTGCTCTATGTCGTATTCTTGGACCGACGCCCTGATAACACCATGTAGTGCTGAGGGAGAGAACTGCCCATCAGCCCACTCAGCAATCTTGGAGAGACATCACAACCTAATCTATTCAACGTCGTCTAGAATCGCTTCTCAACGTCAGAAGAAGGTCACCTTCGACAGGCTGCAGGTGCTCGACGACCATTACAAAACTGCATTAAAGGAGATAAAGGAGCGAGCGTCAAGGGTAAAGGCTCGCATGCTCACCATCGAGGAAGCGTGCGCGCTCGTCCCTCCTCACTCTGCTCGGTCAAAGTTCGGGTATAGTGCGAAGGACGCTCGCTCCCTGTCCAGCAAGGCCATTAACCAGATCCGCTCCGTCTGGGAGGACTTGCTGGAAGACACCACAACTCCAATTCCAACCACCATCATGGCGAAGAGCGAGGTTTTTTGTGTGGATCCTACTAAAGGAGGCCGTTTTTTGCTCGTCTCATTGTCTACCCTGACCTGGGGGTGCGCATCTGTGAGAACGTGCCCTATATGGCGTGATACAGAAGTGGGGAGTGGGGACGATGGGTCCTGCCTATGGATTCCAATACTCGCCTCAACAGCGGGTCGAACGTCTGCTGAAGATGTGGACCTCAAAGAAAGCCCAGTTGGGGTTCTCGTATGGTACCCGCTGCTTTGGCTCGACTGCCACTGGACAGGACATCAGGGTGGAAGAGGAGATATACCAATGCTGGAGCCTTGGACCGGAGGCCAGGAAAGTGATCTCCTCCCTCACGGAGCGGCTTTACTGCGGAGGCCCTATGTTCAACAGCAAGGGGGCCCAGTGTGGTTATCGCCGTTGCCGTGCCAGTGGAGTTCTGCCTACCAGCTTCGGCAACACGATCACTTGTTACATCAAGGCCACAGCGGCTGCAAAGGCCGCAAACCTCCGGAAGCCTGGCTTCTTGTTTGGGGAGGATGGATCCTGGTCGTATTACCTGAGGACCGAATGGGGTTCGAATGGAGATACGGGCAGTCCTGGGAGAGCCTTCACCGGAGGCTATGGACCAGGTATTTCTTGCTTCCACCCGGAGATGGCCCCCACAGGCCAACCCTACGACCTTTGGGCTCATTACATCTGGCTCCTCCAACGTCTCCGTGGCGCGGGACGATACGGGGAAGAGGTATTATTACCTCACTCGTGGTGCCACCACCCCCCTGGCCCGTGCTGCTTGGGAGACAGCTCGTCACACTCCAGTTACCTCCTGGCTGGGGAACATCATCATGTACGCGCCTACTATTTGGGTGCGCATGGTGGTGGTGGCACACTTTTTCTCCATACTCCAATCCCAGGAGATACTTGGTCGCCCCCTTGGCTTTGGAATGTACGGGGCCACTTACTCTGTCACTCCGCTGGATTTACCAGCAATCATTGGAAGACTCCATGGTCTACGCGCGTTTACGCTCCATATTTACTCTCCAGCAGAGCTCAATACGGTCGCGGGGACACTCAGGAAGCTTGTGCCCCCCCCTACGAGCTTGGAGACATCGGGCACGAGCAGTGCGCGCTATGCTTATCGCCCAGGGAGGGAAGGCCAGGATTTGTGGGCTTTATCACTTCAATTGGGCGGTACGCACCAAGACCACCCTCACTCCACTGCCAGCCGCTGGCCAGTTGGATTTATCCATCTGGTTTACGGTTGGTGTCGGCGGGAACGACATTCTCGCAGCGTGTCACGCGCCCGAACCCGCCATTTGCTGCTTTGCCTACTCCCTACTAACAGTAGGGGTAGGCATCTTTCTCTTGCCAGCTCGATGAGCTGGTAAGATAACACTCCATTTCTTTTTTGTTTTTTTTTTTTTTTTTTTT

This is whole genome sequence of Hepatitis C Virus Genome and i want to calculate total no of genes present in the .txt file through R or Python Script

Plz help me

python r

This link might be helpful.

Hello anasjamshed1994!

We believe that this post does not fit the main topic of this site.

Please do not create the same post multiple times. In the previous post (Python Script to Calculate Total Number of genes in 3 ORF ), the moderating comment mentioned the same thing - opening multiple posts for a discussion diverts efforts in the forum and ends up confusing everyone.

For this reason we have closed your question. This allows us to keep the site focused on the topics that the community can help with.

If you disagree please tell us why in a reply below, we'll be happy to talk about it.

Cheers!

I will add to Ram's comment that in your multiple questions you have also had multiple people try to assist you. What you are trying to do is not simple (to do well). It is beyond the forum's abilities to do anything but link you to existing, well tested, and deep solutions. Finding genes is beyond a simple python script - but finding ORFs is not.

So we Can say that finding genes with python script is not possible at any way?

No, its not impossible. But you are looking for pre-written code without demonstrating any effort, and the task is too large for help on the forum.

There is no real reason to try and do this through a python script.

sir so can we use R to calculate genes?

No, you’re missing the point. All of these languages are in principle capable of the task, but what you are asking for from us on this forum is unrealistic. Gene finding is a difficult task. It would require a full application, with complex algorithms. It is more than just a ‘script’.

We have already pointed you toward existing tools that do this.

I disagree with you because i cant find suitable answer for my previous thread so i posted it again and again

Then you should have responded to the comments and feedback in the first thread.

Hi anasjamshed1994 ,

We do not provide readymade solutions to projects, we help you when you have a specific problem that you're unable to solve in spite of putting in your best (or at least a good amount of) effort. If you can demonstrate the two highlights above, we're glad to help you out.

0 answers

No answers yet.

Log in to answer this question.