中文

利用肽段词格加速串联质谱谱图的图模型识别

分子网络 2014-10-30 v1 机器学习

摘要

液相色谱与串联质谱联用技术(即鸟枪法蛋白质组学)是一种广泛用于鉴定复杂生物样品中蛋白质的高通量技术。对典型鸟枪法蛋白质组学实验产生的数万个碎片谱图的分析,始于为每个观测谱图分配一个假设负责生成该谱图的肽段,这通常通过将每个谱图与肽段数据库进行搜索来完成。我们最近描述了一种机器学习方法——用于快速鉴定肽段的动态贝叶斯网络(DRIP)——该方法不仅在多种数据集上实现了最先进的谱图识别性能,而且提供了一个可训练模型,能够返回关于特定肽段 - 谱图匹配的有价值辅助信息。在本文中,我们提出了对 DRIP 的两项重大改进。首先,我们描述了如何使用自然语言处理中广泛使用的词格(word lattices)来显著加速 DRIP 的计算。据我们所知,所有现有的鸟枪法蛋白质组学搜索引擎都是独立计算给定观测谱图与数据库中每个候选肽段之间的得分。词格的关键思想是将候选肽段集合表示为单一数据结构,从而允许在不同候选者之间共享冗余计算。我们证明,将格与 DRIP 结合使用,在酵母和蠕虫数据集上可实现数十倍的速度提升。其次,我们引入了一种 DRIP 变体,该变体使用判别式训练框架,执行最大互熵估计而非最大似然估计。这一修改提高了 DRIP 的统计效力,使我们在 1% 假发现率下能够增加酵母和蠕虫数据集中已识别谱图的数量。

关键词

引用

@article{arxiv.1410.7875,
  title  = {Faster graphical model identification of tandem mass spectra using peptide word lattices},
  author = {Shengjie Wang and John T. Halloran and Jeff A. Bilmes and William S. Noble},
  journal= {arXiv preprint arXiv:1410.7875},
  year   = {2014}
}