I am trying to run QIIME dada2 pipeline on a bunch of samples that I got from a previously published study. I got their raw fastq sequence data but I am running into the issue where it keeps failing at the trimming step (I am using 0 truncation and 0 trimming becasue the visualization shows phred 30 across the entire read for all reads).
Here's what a fastq file looks like and I don't understand why there are duplicate reads, many with "???" instead of a sequence.
@SRR20667927.1 1 length=251
TACGGAGGGTGCTAGCGTTAATCGGAATTACTGGGCGTAAAGGGCACGCAGGCGGTTAATTAAGTTGGATGTGAAATCCCCGGGCTTAACCTGGGAATGGCATTCAATACTGGTTAGCTAGAGTCTTTTAGAGGGGGGTAGAATTCCATGTGTAGCGGTGAAATGCGTAGAGATGTGGAGGAATACCGGTGGCGAAGGCGGCCCCCTGGGCAGAGACTGACGCTCATGTGCGAAAGCGTGGGGAGCACACA
+SRR20667927.1 1 length=251 ???????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????
@SRR20667927.1 1 length=251
NCTGTTTGCTCCCCACGCTTTCGCACCTGAGCGTCAGTCTCTGTCCAGGGGGCCGCCTTCGCCAACGGTATTCCTCCACATCTCTACGCATTTCACCGCTACCCATGGAATTCTACCCCCCTCTACAAGACTCTAGCTAACCAGTCTGGAATGCCATTCCCACGTTAAGCCCGGGGATTTCACATCCAACTTAATTAACCGCCTGCGTGCCCTTTACGCCCAGTAATTCCGATTAACGCTCGCACCCTGCG
+SRR20667927.1 1 length=251 ???????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????
@SRR20667927.2 2 length=251
TACGGAGGGTGCGAGCGTTAATCGGAATTACTGGGCGTAAAGGGCACGCAGGCGGTTTATTAAGTTGGATGTGAAATCCCCGGGCTTAACCTGGGAATGGCATTCAAGACTGGTTAGCTAGAGTCTTGTAGAGGGGGGTAGAATTCCATGTGTAGCGGTGAAATGCGTAGAGATGTGGAGGAATACCGGTGGCGAAGGCGGCCCCCTGGACAGAGACTGACGCTCATGTGCGAAAGCGTGGGGAGCAAACA
+SRR20667927.2 2 length=251 ???????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????
@SRR20667927.2 2 length=251
NCTGTTTGCTCCCCACGCTTTCGCACATGAGCGTCAGTCTCTGTCCAGGGGGCCGCCTTCGCCACCGGTATTCCTCCACATCTCTACGCATTTCACCGCTACACATGGAATTCTACCCCCCTCTACAAGACTCTAGCTAACCAGTCTTGAATGCCATTCCCAGGTTAAGCCCGGGGATTTCACATCCAACTTAATTAACCGCCTGCGTGCCCTTTACGCCCAGTAATTCCGATTAACGCTCGCACCCTCCG
+SRR20667927.2 2 length=251 ???????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????
@SRR20667927.3 3 length=251
GATAAACTTGCCTTGAGAAGTGAAACTGAGTTCTAAGAAAGAAGTACGTGCGTAGATGGAAGATTAAAAATAATCGACGTACAAGATGGAAAAAAGGAGAGATGTTTTAATTCGATCCGTAAGCACCGTTACGGTCGTATTAAGATTCCAGGCTTTTTGACTTCACTGCAACTCGCCGTAAATACGTATCAGCTGTGACGAATGGGAGCGTGTTTATTACGACACTAACAGCTTCACCAATCAATGATTAG
+SRR20667927.3 3 length=251 ???????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????????
The error I get in QIIME is the following:
R version 4.3.3 (2024-02-29) Loading required package: Rcpp DADA2:
1.30.0 / Rcpp: 1.0.13 / RcppParallel: 5.1.9 2) Filtering ........................................................ 3) Learning
Error Rates 265188844 total bases in 1056776 reads from 14 samples
will be used for learning the error rates. Error rates could not be
estimated (this is usually because of very few reads). Error in
getErrors(err, enforce = TRUE) : Error matrix is NULL.
Please can someone help I have been stuck on this for days. I have never had issues before. I know the data is paired but it looks like they had uploaded it to NCBI as already merged R1 and R2 sequences, so for each sample I have one fastq file. I have used the
--input-format SingleEndFastqManifestPhred33V2
I don't think I need to separate these reads because I have never had to do that before with paired-end fastq data that I have received as a single file.
fastq