中文

SNIP:一种用于系谱数据去重的排序邻域方法改进算法

应用统计 2021-08-20 v1 统计方法学

摘要

系谱数据包含用于分析遗传性疾病家族史信息。由于同一家庭多次就诊或临床医生为测试目的输入多个家庭版本,这些临床数据集可能包含重复记录。在移除重复项之前从数据中得出结论或将其用于训练或验证可能导致无效结论,因此识别重复项至关重要。由于家庭结构可能复杂,现有去重算法无法直接应用。我们首先通过考察系谱重复项对家族风险预测模型训练和验证的影响来阐明去重的重要性。然后我们引入一种无监督算法,称之为 SNIP(Sorted NeIghborhood for Pedigrees,系谱排序邻域),该算法基于排序邻域方法,利用系谱固有的层次结构高效查找并分类成对比较。我们进行模拟研究以评估算法性能,并找到算法能够准确检测重复项的参数配置。然后将该方法应用于 Risk Service 的数据,其中包含超过 300,000 个具有高遗传性癌症风险的系谱,并发现了潜在重复家庭的大型簇。在移除 104,520 个系谱(原始数据的 33%)后,所得的 Risk Service 数据集现在可用于未来的分析、训练和验证。该算法作为 R 包 snipR 提供,网址为 https://github.com/bayesmendel/snipR。

关键词

引用

@article{arxiv.2108.08773,
  title  = {SNIP: An Adaptation of Sorted Neighborhood Methods for Deduplicating Pedigree Data},
  author = {Theodore Huang and Matthew Ploenzke and Danielle Braun},
  journal= {arXiv preprint arXiv:2108.08773},
  year   = {2021}
}

备注

39 pages, 22 figures (including supplementary materials)