This is a test version of Biostars. For the public version, visit https://www.biostars.org.
Strange Per base sequence content of fastqc

Hi, all! I download fastq.gz files of GSE162708 from ENA which only have 2 files of each sample(usually scRNA-seq has 3 files I1 , R1 & R2 ). Then I run fastp as following

for i in `seq 1 4`
do
    echo SRR1320051${i}
    fastp -i ./fastq/SRR1320051${i}_1.fastq.gz -o SRR1320051${i}_R1.fastq.gz \
        -I ./fastq/SRR1320051${i}_2.fastq.gz -O SRR1320051${i}_R2.fastq.gz  -w 6
done

Then I get QC report , but I can't understand why Per base sequence content of Read1 looks so strange . The original R1 sequence like this

@SRR13200511.1 1/1 CNGGGCTAGCGTCAAGTTTCGGCTCCGCCTCGGCGCAAATTTTTTTTTTTTTTTTTTTTTTTTTTTTGGGTGGGGGGGAAAGGGGGGGATTGTAATGG + F#FFFFFFFFFFFFF:FFFFFFFFFFFF:::,FF::F,,,FFFF:,:,F::,:F:FFF:::F,,,,,F,:,:,FFFFF,,,:,FFF,:,,,:,,,,FF

@SRR13200511.2 2/1 TNGCGTGCAAGTGCAGTGACCGCCACTATTCATCGCAAATTTTTTTTTTTTTTTTTTAAAAAAATATGTTTTTATATTATAATTTACCTATATTATAT + F#FFFFFFFFFFFFFFFFFFFFFF:FFF,F:,,:F,:,:FFFFFFFFFFFFFFFFFFF,FFFF,,:,:F,FFF,,,,:,,FF,FF,,,,::,,,,,,,

@SRR13200511.3 3/1 GNTCTGGGTGCAGTGATAAAACGTTCATGTAAGATGATTTTTTTTTTTTTTTTTTTTTAAACCCCCACAAAAAAATTTTTAAAAAAACAAGAAGGGTC + F#FFFFFFFFFFFFFFFF:FFFFFFFFF,F,,FFF,FFFFFFFFFFFFFFFFFFFFFFF,,F:FFF,FF,,,::FFF,,F:,FF:F,:,,,,:,:F,,

zcat SRR13200511_2.fastq.gz | awk -F "" '{print NF}'|head

18
150
1
150
18
150
1
150
18
150

enter image description here

It would be greatly appreciated if anyone can tells what cause the strange Per base sequence content !

fastqc scrna-seq

1 answer

It does not make a lot of sense to run FastQC on scRNAseq data.

R1 - Contains UMI and cell barcodes (generally after ~28 bp there is non-usable sequence plus polyT as you see in your example)
I1 - Is the sample level index.
R2- Is the actual read data that contains the cDNA.

So if anything you should only run FastQC on Read 2. Sample you downloaded is already demultiplexed so you have only two files.

Log in to answer this question.