面向大规模肽鉴定的高效在线学习
机器学习
2018-05-09 v1 机器学习
摘要
动机:在串联质谱(MS/MS)肽鉴定中,数据库搜索后处理是精炼由数据库搜索引擎生成的肽-谱匹配(PSMs)的关键步骤。尽管已开发许多基于统计和机器学习的方法来提高肽鉴定的准确性,但在大规模数据集以及假阳性比例极高(困难数据集)的数据集上仍存在挑战。需要更高效的学习策略以提升困难数据集上肽鉴定的性能。结果:本工作中,我们提出一种在线学习方法来攻克现有肽鉴定算法遗留的挑战。我们通过分别对诱饵和目标 PSMs 使用不同损失函数,提出一种代价敏感学习模型。对错误选择诱饵 PSMs 的惩罚大于对目标 PSMs 的惩罚,因此新模型可降低其在困难数据集上的错误发现率。此外,我们设计了一种在线学习算法 OLCS-Ranker 来求解所提学习模型。OLCS-Ranker 并非一次性使用所有训练数据样本,而是在每轮迭代中仅向学习模型输入一个训练样本。因此,大规模问题的内存需求显著降低。实验研究表明,OLCS-Ranker 在准确性和稳定性上优于 CRanker 和 Batch-CS-Ranker 等基准方法。而且,在大型数据集上 OLCS-Ranker 比 CRanker 方法快 15–85 倍。可用性与实现:OLCS-Ranker 软件可免费用于非商业用途,地址为 https://github.com/Isaac-QiXing/CRanker。
引用
@article{arxiv.1805.03006,
title = {Efficient online learning for large-scale peptide identification},
author = {Xijun Liang and Zhonghang Xia and Yongxiang Wang and Ling Jian and Xinnan Niu and Andrew Link},
journal= {arXiv preprint arXiv:1805.03006},
year = {2018}
}
备注
16 pages, 3 figures