基于似然的B细胞克隆家族推断
种群与进化
2017-02-08 v2
摘要
人类免疫系统依赖于高度多样化的制抗体B细胞集合。B细胞受体序列多样性由称为“重排”的随机重组过程生成祖B细胞,然后是称为“亲和力成熟”的达尔文式谱系多样化与选择过程。由此产生的受体可高通量测序用于研究和诊断。这样的序列集合包含各种谱系的混合物,每个谱系可能数量众多,或仅由单个成员组成。作为理解此多样化过程与结果的一步,人们可能希望重构谱系归属,即根据哪些序列来自相同的重排事件对采样序列进行聚类。我们称此聚类问题为“克隆家族推断”。本文描述并验证了一个基于B细胞受体序列的多隐马尔可夫模型(multi-HMM)框架的克隆家族推断似然框架。我们描述了一种寻找最大似然聚类的凝聚算法,两种在速度与准确性间有不同权衡的近似算法,以及第三种用于寻找特定谱系的快速算法。我们展示在模拟下这些算法大幅改进了现有的克隆家族推断方法,并且当应用于两个真实数据集时,它们给出的聚类与先前方法显著不同。
引用
@article{arxiv.1603.08127,
title = {Likelihood-based inference of B-cell clonal families},
author = {Duncan K. Ralph and Frederick A. Matsen},
journal= {arXiv preprint arXiv:1603.08127},
year = {2017}
}