This is a test version of Biostars. For the public version, visit https://www.biostars.org.
seqtk subseq in.fastq list.txt > out.fastq not extracting full sequence from input file

My in.fastq file is this:

@A00869:294:HCW57DSXY:2:1101:3929:1000 1:N:0:ACTGGACA+ACTGGACA
GCCACTCTGGCTATGTGAATACGGTGGCGGTGTCGCCTGATGGGTCGCTTTGCGCGAGCGGAGGGAAAGATGGGACTATTTTGTTGTGGGACTTGTCGGAGGGCAAGAGGCTTTACTCGCTCGATGCTGGCTCGATCATTAATGCTCTC
+
FFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFF:FFFFFFFFFFFFFFFFFF:FFFFFFFFFFFFFFFFFFFFFFF:FFFFFFFFFFFFFFFFFFFFFFFFFFF:FFFFFFFFFFFFFFFFFFFFF
@A00869:294:HCW57DSXY:2:1101:5882:1000 1:N:0:ACTGGACA+ACTGGACA
TTTTGCCTAGTTTCTTCATTGTTGGGTCGTTTCACAACTCATGCTGTTGGGTCGGAGGCTATTGGGATTCTTGTGAATTTCGATCTCAATTCGGAATCGATAACCAATTTGATGCAACCTGCGAAGGTATCGTTAATGGTGGACATGTT
+
FFFFFFFFFFFFFFFFFFFFFFFF:FFFFFFFFFFFFFFFFFFF,FFFFFFFFFF:FFFFF,FFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFF

My ID list is this:

A00869:294:HCW57DSXY:2:1101:3929:1000 1:N:0:ACTGGACA+ACTGGACA

A00869:294:HCW57DSXY:2:1101:5882:1000 1:N:0:ACTGGACA+ACTGGACA

A00869:294:HCW57DSXY:2:1101:5882:1000 1:N:0:ACTGGACA+ACTGGACA

I am using the above subject command correctly but the output file does not contain the full sequence. The output file sequence contains like this:

@A00869:294:HCW57DSXY:2:1101:3929:1000 1:N:0:ACTGGACA+ACTGGACA

A

+

F

@A00869:294:HCW57DSXY:2:1101:5882:1000 1:N:0:ACTGGACA+ACTGGACA

A

+

F

@A00869:294:HCW57DSXY:2:1101:5882:1000 1:N:0:ACTGGACA+ACTGGACA

T

+

F

Anyone can explain why output file not containing the full sequence but only one basepair with each ID?

subseq seqtk extractionproblem

1 answer

Use everything before the whitespace in list.txt, for example A00869:294:HCW57DSXY:2:1101:3929:1000 and not A00869:294:HCW57DSXY:2:1101:3929:1000 1:N:0:ACTGGACA+ACTGGACA.

https://github.com/lh3/seqtk/issues/180

Please accept the answer (green check mark) to provide closure to this thread.

Log in to answer this question.