Hii people,
I have paired-end sequence read of my target species which I have mapped to the reference genome which outputed bam files. From this bam files I wish to extract protein coding genes using homology based approach or de novo.
Question:
Is it in order if I convert the bam files(obtained by mapping to reference) to fastq files, merge the paired reads, then convert the fastq files to fasta format? The idea is to get fasta files from the reads for feature prediction purposes.
If that is the way to do it how to one get continues fasta sequences , since on following the mentioned step I get something like this:
HWI-574/1
TTCTTGGTCCATGTACTGCTGAAGCCCTGGCATGTGAAATGAGTGCAAATGTACAGTAGTTTGAA
55086/1
TAAAAGTTCTTGGTCCATGTACTGTTTCCTTACTGGCATGTGAAATGAGTGCAAATGTACAGTAGTTTGAA
HWI-D00466:100:CADMYANXX:7:1111:1943:12062/1
AGTGAAGCAGAAGTGGATATTTTTCTGGAATTCCCTTGCTTTCTCTGTGATCCAAGGGAT
75804/1
CCCTTGGATCACAGAGAAAGATATCCACTTCTGCTTCACTGACTACACTTAAAGCCTTTGACTGTGT
16:15787:83520/1
GAAAGCAAGGGAATTCCAGAAAAATATCCACTTCTGCTTTTGACTGTGTGGATCACAACAAGC
I expect to get something like this;
chr1
TTCTTGGTCCATGTACTGCTGAAGCCCTGGCATGTGAAATGAGTGCAAATGTACAGTAGT
TTGAATAAAAGTTCTTGGTCCATGTACTGTTTCCTTACTGGCATGTGAAATGAGTGCAAA
TGTACAGTAGTTTGAAAGTGAAGCAGAAGTGGATATTTTTCTGGAATTCCCTTGCTTTCT
CTGTGATCCAAGGGATCCCTTGGATCACAGAGAAAGATATCCACTTCTGCTTCACTGACT
ACACTTAAAGCCTTTGACTGTGTGAAAGCAAGGGAATTCCAGAAAAATATCCACTTCTGC
TTTTGACTGTGTGGATCACAACAAGC...........................................................
I would appreciate your input on how to go about it.
bam
protein-coding genes
fastq
fasta
paired-reads