基于机器学习的蛋白质组学发现
定量方法
2013-12-05 v1
摘要
蛋白质组学鉴定的最终目标是识别和定量生物体中的蛋白质。基于无标记蛋白质定量的质谱法(MS)主要集中于分析肽谱计数和离子峰高。利用若干观察到的肽段(蛋白质特征肽)可以识别来源蛋白质。然而,每个肽段被检测到的可能性受到肽段理化性质的严重影响,这混淆了质谱计数的结果。利用四种不同蛋白质组学平台产生的大约一百万个肽段鉴定结果,我们成功识别了超过16,000个蛋白质特征肽。我们使用机器学习分类来推导肽段检测概率,用于预测将观察到的胰蛋白酶肽段数量,从而可以高精度地估计蛋白质的绝对丰度。我们使用(中科院实验室提供的)肽段数据,从不同方法中推导出最佳模型。我们首先采用SVM和随机森林分类器来识别蛋白质特征肽和未观察到的肽段,然后搜索最佳参数以获得更好的预测结果。考虑到我们模型的优异性能,我们可以计算蛋白质丰度的绝对估计。
引用
@article{arxiv.1312.1025,
title = {Discovery of Proteomics based on Machine learning},
author = {Biao He and Baochang Zhang and Yan Fu},
journal= {arXiv preprint arXiv:1312.1025},
year = {2013}
}