北京基因组所对大样本全基因组数据的群体遗传学分析步骤开发获重要进展
推算基因组学旨在发展理论和步骤学,对基因组数据进行数据挖掘、提守信息。其中对遗传多态性,如基因频谱、单倍型结构等进行建模,利用群体基因组水平的遗传变异数据来揣度群体的汗青和变迁是群体遗传学的主题内容。传统的群体遗传学分析步骤通;谟籽臼,所揣度的多为相对古老的汗青事务,例如,被宽泛利用的Li and Durbin (2011)的PSMC步骤(递次式对偶溯祖步骤)合用于2万年到300万年之间的群体大幼变动,对一万年以内群体汗青的揣度精度很有限。该功夫区间是这些步骤进行参数揣度的“盲区”。而人类在从前一万年左右从漫长的狩猎-采集文化逐步过渡到农业、畜牧业和工业文化,深刻相识人类两万年内的群体进化和变迁,对解析环境适应性、遗传性疾病的易感性和发病机造等都有重要意思。
一日千里的测序新技术在产生海量的基因组序列数据。这些大样本或群体水平的测序数据为基因组时期的群体遗传学钻研提供了前所未有的机缘。大数据蕴含的丰硕信息使得更精密揣度群体汗青,蕴含1万年甚至几千年以内的群体变动成为可能。但另一方面,也给现有的理论和步骤带来了新的挑战。无数现有的分析步骤并不合用分析大数据:一方面是由于这些传统步骤大多是基于随机取样步骤,推算量太大;另一方面则源于一些公式在大样本前提下存在数值不不变性。
亚星游戏推算基因组中心陈华课题组针对以上问题提出了一个群体遗传学新算法(TNSFS)。该步骤克服了大样本时的数值推算问题,初次实现了对大样本全基因组数据进行推算高效的群体遗传学分析,可用于检测群体的增长模式,有效揣度一万年以内的群体大幼变动的有关参数。新算法占有若干推算上的优势:该步骤给出解析大局的公式,不依赖于仿真,推算便捷高效,并且在大样本时无数值问题;拥有很好的矫捷性,能涵盖复杂的群体模型;此表,现代群体遗传学模型以Kingman溯祖理论为根基构架,理论上只合用于样本量远幼于群体大幼的前提下。当样本数量很大,甚至于靠近群体水平时,Kingman溯祖理论会有严重误差。新提出的步骤即便在这种情况下,也拥有很好的鲁棒性(robustness)。
该工作的钻研成就于2015年11月颁发在进化生物学领域权威期刊 Molecular Biology and Evolution。

TNSFS步骤能有效仿照复杂的群体模型(如图A所示,用于描述欧洲群体变动的Gazave模型), 并且在分歧参数值下的理论预测值与电脑仿真产生的了局吻合(图B)
论文链接






