用于质谱蛋白质学中无诱饵假发现率估计的新混合模型
定量方法
2020-09-18 v1
摘要
动机:准确估计谱图鉴定的假发现率(FDR)是基于质谱的蛋白质组学中的核心问题。在过去二十年中,目标诱饵方法和无诱饵方法被广泛用于估计 FDR。TDA 使用诱饵序列数据库来忠实地模拟错误肽段-谱图匹配(PSM)的得分分布。而 DFA 则拟合二分量混合模型,以学习正确和错误 PSM 得分分布的参数。尽管在概念上直观,但这两种方法在实践中都会遇到问题,特别是在将仪器性能推向极限并产生低碎裂效率和低信噪比谱图的实验中。结果:我们引入了一个新的无诱饵 FDR 估计框架,该框架推广了现有的 DFA,同时以类似于 TDA 的方式利用了更多的搜索数据。我们的方法依赖于多分量混合模型,其中与正确 PSM、最佳错误 PSM 和次佳错误 PSM 对应的得分分布由偏态正态族建模。我们推导了 EM 算法,从与每个实验谱图相关的最佳和次佳 PSM 的得分中估计这些分布的参数。我们在多个蛋白质组学数据集和包含超过一百万张谱图的 HeLa 细胞酶解案例研究中评估了我们的模型。我们提供了证据表明,其性能优于现有的 DFA,且与 TDA 相比具有更好的稳定性和速度,且没有任何性能下降。我们提出,新策略有潜力扩展到肽段鉴定之外,并减少在所有分析平台上对 TDA 的需求。
引用
@article{arxiv.2009.08023,
title = {New mixture models for decoy-free false discovery rate estimation in mass-spectrometry proteomics},
author = {Yisu Peng and Shantanu Jain and Yong Fuga Li and Michal Gregus and Alexander R. Ivanov and Olga Vitek and Predrag Radivojac},
journal= {arXiv preprint arXiv:2009.08023},
year = {2020}
}