Hi, all! I download fastq.gz files of GSE162708 from ENA which only have 2 files of each sample(usually scRNA-seq has 3 files I1 , R1 & R2 ). Then I run fastp as following
for i in `seq 1 4`
do
echo SRR1320051${i}
fastp -i ./fastq/SRR1320051${i}_1.fastq.gz -o SRR1320051${i}_R1.fastq.gz \
-I ./fastq/SRR1320051${i}_2.fastq.gz -O SRR1320051${i}_R2.fastq.gz -w 6
done
Then I get QC report , but I can't understand why Per base sequence content of Read1 looks so strange . The original R1 sequence like this
@SRR13200511.1 1/1 CNGGGCTAGCGTCAAGTTTCGGCTCCGCCTCGGCGCAAATTTTTTTTTTTTTTTTTTTTTTTTTTTTGGGTGGGGGGGAAAGGGGGGGATTGTAATGG
+F#FFFFFFFFFFFFF:FFFFFFFFFFFF:::,FF::F,,,FFFF:,:,F::,:F:FFF:::F,,,,,F,:,:,FFFFF,,,:,FFF,:,,,:,,,,FF@SRR13200511.2 2/1 TNGCGTGCAAGTGCAGTGACCGCCACTATTCATCGCAAATTTTTTTTTTTTTTTTTTAAAAAAATATGTTTTTATATTATAATTTACCTATATTATAT
+F#FFFFFFFFFFFFFFFFFFFFFF:FFF,F:,,:F,:,:FFFFFFFFFFFFFFFFFFF,FFFF,,:,:F,FFF,,,,:,,FF,FF,,,,::,,,,,,,@SRR13200511.3 3/1 GNTCTGGGTGCAGTGATAAAACGTTCATGTAAGATGATTTTTTTTTTTTTTTTTTTTTAAACCCCCACAAAAAAATTTTTAAAAAAACAAGAAGGGTC
+F#FFFFFFFFFFFFFFFF:FFFFFFFFF,F,,FFF,FFFFFFFFFFFFFFFFFFFFFFF,,F:FFF,FF,,,::FFF,,F:,FF:F,:,,,,:,:F,,
zcat SRR13200511_2.fastq.gz | awk -F "" '{print NF}'|head
18
150
1
150
18
150
1
150
18
150
It would be greatly appreciated if anyone can tells what cause the strange Per base sequence content !
1 answer
It does not make a lot of sense to run FastQC on scRNAseq data.
R1 - Contains UMI and cell barcodes (generally after ~28 bp there is non-usable sequence plus polyT as you see in your example)
I1 - Is the sample level index.
R2- Is the actual read data that contains the cDNA.
So if anything you should only run FastQC on Read 2. Sample you downloaded is already demultiplexed so you have only two files.
Log in to answer this question.