This is a test version of Biostars. For the public version, visit https://www.biostars.org.
dxy (Nei 1987) calculation

Is there any scripts out there that can calculate absolute divergence (dxy) between populations/species using many alignments of sequence data?

snp next-gen sequence alignment

Could you give the right reference to the paper and possibly explain the terms in the equation?

Thanks, and I should have put this in my first comment: Do you have some example dataset to play with? (In general it's good to make life easier to those willing to answer questions...)

Below are 3 example alignments

Locus1:

#NEXUS
begin data;
    dimensions ntax=2 nchar=460;
    format datatype=dna missing=? gap=-;
matrix
species1 ?????????????????????TAGTCCTTACACTGTAAAAAACTTTGGAATTGTTTGACCCTGTAAACACAAAATTCATGTCTCTCACCCTGGGACAAATACATTCTTTTTAAAAGCAGCATATGGGCAGCCTTGGACTGATGTTAGTTTATTGTCACTGCTTGATAACATTTAATGGAAAAGATACAAGAGTGCCAAAGAATTTTAATTATTTTTGTGATAAAGTTATATGTTCGGCCTTGAAAAAGTGGAGATAATGCTGGGATTCATTATTATTCCCAGTGTGTTTAAACAGACGACACAGAATGCAAACAAAAGCAGATGAAATTTGAAAAGTATTATCAATATT???????????????????????????????????????????????????????????????????????????????????????????????????????????????
species2 TGTGTGCATGCACAGATTTTTTAGTCCTTACACTGTAAAAAACTTTGGAATTGTTTGACCCTGTAAACACAAAATTCATGTCTCTCACCCTGGGACAAATACATTCTTTTTAAAAGCAGCATATGGGCAGCCTTGGACTGATGTTAGTTTATTGTCACTGCTTGATAACATTTAATGGAAAAGATACAAGAGTGCCAAAGAATTTTAATTATTTTTGTGATAAAGTTATATGTTCGGCCTTGAAAAAGTGGAGATAATGCTGGGATTCATTATTATTCCCAGTGTGTTTAAACAGACGACACAGAATGCAAACAAAAGCAGATGAAATTTGAAAAGTATTATCAATATTGCAGATAGCAGATGCCCTTTCCAATCAGAACAAGCATATCTTCTATAGCAACTTTATGGTTGAGTAGTTTATTCATTTCTATTAGAAGGTTGTACGTTTCTAAAATATGTA
;
end;

Locus2:

#NEXUS
begin data;
    dimensions ntax=2 nchar=582;
    format datatype=dna missing=? gap=-;
matrix
species1 ????????????????????????????????????????AACCACAATTGGTTGTCTGTTTTCTACTTTATGACATTTCCACTGAAAATTGTAATTCTTTTTTGCTGTGTTCTATTCCCCTTGTACGGAGTGTCCCCTTGGGAAGTGGGGCCCAAGAGCCCTTTCTAGGATGGGACAGGATATTACAGCTTGGTTTGTGCACCAGCATCCTTAATATTTCCTTCCTTTCAGAAGCAAATAGAGCGTACCCTTATCTGAATGCTAATTTCCTAGTTAAAACCCTCCCTTGCTGACAAGGGACTGAAAGAGTTTTAAATCACAGATGTAGAGTATCAAATGCAATAATGCTCTTGCAATAGTGCATTGAAGCCTCAATTAATTAACCCTTGGGCTAAGTAGGCAGGTACATGGTGGTGGCCACAGGCGGTGGATGGATGAGATTTAAATGGGCATCTCATTTCCTCA????????????????????????????????????????????????????????????????????????????????????????????????????????????????????
species2 ????????????????????????????TTCTGAAAAATAAACCACAATTGGTTGTCTGTTTTCTACTTTATGACATTTCCACTGAAAATTGTAATTCTTTTTTGCTGTGTTCTATTCCCCTTGTACGGAGTGTCCCCTTGGGAAGTGGGGCCCAAGAGCCCTTTCTAGGATGGGACAGGATATTACAGCTTGGTTTGTGCACCAGCATCCTTAATATTTCCTTCCTTTCAGAAGCAAATAGAGCGTACCCTTATCTGAATGCTAATTTCCTAGTTAAAACCCTCCCTTGCTGACAAGGGACTGAAAGAGTTTTAAATCACAGATGTAGAGTATCAAATGCAATAATGCTCTTGCAATAGTGCATTGAAGCCTCAATTAATTAACCCTTGGGCTAAGTAGGCAGGTACATGGTGGTGGCCACAGGCGGTGGATGGATGAGATTTAAATGGGCATCTCATTTCCTCAGCACGGAACATGCCGTTTGATTCAGAAAGGAGTCATTTTACACACTCGCCTCATTTACGCTCAGCTTTAATCCCTTTAATTCCACCTGAGATCCAAGCAAGAATGGGAAAAGAGAG
;
end;

Locus3:

#NEXUS
begin data;
    dimensions ntax=2 nchar=610;
    format datatype=dna missing=? gap=-;
matrix
species1 ?????TATGTCTTGGTCTAGACTGAAGCAGAAACTCCAGGTCAGACATATGGTGACTGAAAAAGTGCATGTTATTTATTCATATCTCTTAATGTGAAATGTGTATTTGAAGAGACTTAAAATCTCTGAAAGAGCCAATTACTCTCAGCTTTTTAATTCTAGCAATACATTTGGAACATTTTCATTGTTCTAAGGGTTAAAAACCTCACCGTGACAATGATGAGCCTTATTACTCAGTCAAAGTAAATGGATCACCATATAACCTTTCAGAAATGTTCTTCCTTAAGCTATTAAAACATTCCATGCCCTTAGATGACAACAATTTCTCTGCCTTTTGAAATTTCTTTTCTATCCTGCAGAGTTCATAGAGATATGCTTGGTTAAAATCAACTTATATAAAACTATGCACTGTAAATTCTGACACTTCTGTTTGAATCTCTTTTCAAACACTTGTCTTTGCTCACCATAATAGATGTCAGTTCTTCTGATGTAGTTCAAGCATGAGCTTCATATGAAGACTCAGCTATGTCTATTGCATTTCTGAAGCTACTACTCACTGAAGTTTTGTGCTGTTTGACATCAAAGATAGGCAAGAATCACCTGCTGAGTTC
species2 TAAGGTATGTCTTGGTCTAGACTGAAGCAGAAACTCCAGGTCAGACATATGGTGACTGAAAAAGTGCATGTTATTTATTCATATCTCTTAATGTGAAATGTGTATTTGAAGAGACTTAAAATCTCTGAAAGAGCCAATTACTCTCAGCTTTTTAATTCTAGCAATACATTTGGAACATTTTCATTGTTCTAAGGGTTAAAAACCTCACCGTGACAATGATGAGCCTTATTACTCAGTCAAAGTAAATGGATCACCATATAACCTTTCAGAAATGTTCTTCCTTAAGCTATTAAAACATTCCATGCCCTTAGATGACAACAATTTCTCTGCCTTTTGAAATTTCTTTTCTATCCTGCAGAGTTCATAGAGATATGCTTGGTTAAAATCAACTTATATAAAACTATGCACTGTAAATTCTGACACTTCTGTTTGAATCTCTTTTCAAACACTTGTCTTTGCTCACCATAATAGATGTCAGTTCTTCTGATGTAGTTCAAGCATGAGCTTCATATGAAGACTCAGCTATGTCTATTGCATTTCTGAAGCTACTACTCACTGAAGTTTTGTGCTGTTTGACATCAAAGATAGGCAAGAATCACCTGCTGAGTTC
;
end;

2 answers

Hi... Back to the question above, how to calculate window-based Dxy between two populations given a set of genomewide SNP dataset using R? I am still at the early stage in R or perl.

Many thanks in advance.

I guess R would be the fastest way to do this...By the way, I eventually managed to calculate windows of 10kb nucleotide diversities (pi, π) for each population πx and πy. This may be another silly question, can I use these π values to estimate the Dxy between the two populations?

In this paper, there is a link to their supplementary material. Within, these is a genomescan_dxy.pl.

I'm not understanding Perl enough to be able to read and interpret what is happening, but that could be one way of doing it.

Log in to answer this question.