kalis:用于R语言中局部血统推断的Li & Stephens模型的现代实现
统计计算
2024-06-07 v1 应用统计
摘要
近似 个 phased haplotypes 在基因组上一组变异处的近期系统发育,是现代群体基因组学的核心问题,对于进行全基因组关联、选择、基因渗入及其他信号筛选至关重要。Li & Stephens (LS) 模型提供了一个简单而强大的隐马尔可夫模型,用于推断给定变异处的近期血统,表示为基于后验解码的 距离矩阵。然而,LS 模型现有的后验解码实现无法扩展到包含数万至数十万基因组的现代数据集。本工作致力于提供一个高性能的 LS 模型计算引擎,使用户能够在其基础上快速开发一系列特定变异的血统推断流程,并通过统计编程语言 R 中易于使用的 kalis 包暴露出来。kalis 同时利用多核并行和现代 CPU 向量指令集,从而能够扩展到此前因速度极慢而难以处理的问题规模。所得的距离矩阵使得在现代大规模基因组数据集中进行局部血统、选择和关联研究成为可能。
引用
@article{arxiv.2212.11403,
title = {kalis: A Modern Implementation of the Li & Stephens Model for Local Ancestry Inference in R},
author = {Louis J. M. Aslett and Ryan R. Christ},
journal= {arXiv preprint arXiv:2212.11403},
year = {2024}
}
备注
34 pages, 5 figures. For software documentation, see https://kalis.louisaslett.com/ and for source code repository, see https://github.com/louisaslett/kalis