减少大规模谱系分析中检测到的普遍存在的假阳性同源相同片段
种群与进化
2014-02-11 v2 基因组学
摘要
分析个体间同源相同 (IBD) 共享的基因组片段是许多遗传学应用的基础,从人口统计学推断到疾病遗传力估计,但在非模拟数据中 IBD 检测的准确性很大程度上未知。原则上,它可以利用已知谱系进行评估,因为根据定义,IBD 片段是在家族树中无重组地遗传下来的。我们从 23andMe, Inc. 数据集中提取了 25,432 名基因分型的欧洲个体,其中包含 2,952 个父 - 母 - 子三人组。随后,我们使用了广泛使用的 IBD 检测方法 GERMLINE 来检测该队列内的 IBD 片段。利用已知的家族关系,我们发现 2-4 厘摩 (cM) 片段的假阳性率超过 67%,这与在这些大小下模拟数据中报告的准确性形成鲜明对比。几乎所有的假阳性都源于在检测 IBD 时允许单倍型转换错误,这是在存在不完美定相的情况下检索长 (> 6 cM) 片段所必需的。我们引入了 HaploScore,这是一种新颖且计算高效的指标,它根据 IBD 片段包含的转换错误数量对其进行评分。将 HaploScore 过滤应用于 IBD 数据,在精度为 0.8 时,与基于长度的过滤相比,召回率提高了 13 倍。我们复现了假 IBD 的发现,并使用来自 1000 Genomes 项目的 555 名欧洲个体的独立队列证明了 HaploScore 对其他数据源的通用性。只要具备基因分型错误率和转换错误率的估计值,HaploScore 就可以提高任何 IBD 检测方法报告的片段的准确性。
引用
@article{arxiv.1311.1120,
title = {Reducing pervasive false positive identical-by-descent segments detected by large-scale pedigree analysis},
author = {Eric Y. Durand and Nicholas Eriksson and Cory Y. McLean},
journal= {arXiv preprint arXiv:1311.1120},
year = {2014}
}
备注
35 pages, 16 figures