So, I removed duplicates prior to macs2 ( with bbmap clumpify.sh option 'dedupe') cause I was curious of how many reads were left after removing duplicates in fastq files and by mistake I runned macs2 on both the files without duplicates and files with duplicates. It gave different number of peaks! If macs2 removes duplicates shouldn't the number of peaks be the same?
Then, what is most correct to use the files with or without duplicates?
Code follows below:
cd /home/tbarata/
INPUT=ChIPseq_raw_data
OUTPUT=ChIPseq_analysis_20181026/Results
for i in `find $INPUT | grep -i '.*[.]fastq$'`
do
FILENAME=$(echo $i | rev | cut -f 1 -d '/' | rev )
echo $FILENAME
FILEDIRECTORY=$(echo $i | cut -d'/' -f2- | rev | cut -d'/' -f2- | rev)
echo $FILEDIRECTORY
DUPOUTFILE=$FILEDIRECTORY/treated_fastq/withduplicates_$FILENAME
OUTFILE=$FILEDIRECTORY/treated_fastq/$FILENAME
docker pull quay.io/biocontainers/trimmomatic:0.36--5
docker_id=$(docker run -d -t -v /home/tbarata/:/data/ \
quay.io/biocontainers/trimmomatic:0.36--5 bash -c 'touch /data/$OUTPUT/$OUTFILE\_summary; trimmomatic SE -threads 15 -phred33 /data/$i /data/$OUTPUT/$DUPOUTFILE CROP:79 ILLUMINACLIP:/data/allTruSeqAdapSE.fa:2:30:10 LEADING:0 TRAILING:0 SLIDINGWINDOW:0:0 MINLEN:36 AVGQUAL:20 > /data/$OUTPUT/$OUTFILE\_summary')
echo $docker_id
docker wait $docker_id
docker run -t -v /home/tbarata/:/data/ quay.io/biocontainers/bbmap:38.16--0 clumpify.sh in=/data/$OUTPUT/$DUPOUTFILE out=/data/$OUTPUT/$OUTFILE dedupe
done
and results were:
wc -l *
505 GFI1B_3TF_day2_macsFDR_0.05_rep1_peaks.narrowPeak
506 withduplicates_GFI1B_3TF_day2_macsFDR_0.05_rep1_peaks.narrowPeak
43 GFI1B_3TF_day2_macsFDR_0.05_rep2_peaks.narrowPeak
47 withduplicates_GFI1B_3TF_day2_macsFDR_0.05_rep2_peaks.narrowPeak