中文

从iTRAQ质谱(LC-MS/MS)数据中挖掘时序模式

定量方法 2011-05-02 v1 计算工程、金融与科学 数据库 数据结构与算法 分子网络

摘要

大规模蛋白质组学分析正成为生物学中一项强大的技术,并高度依赖由先进质谱仪获取的数据。与系统生物学中的任何其他领域一样,需要计算工具来处理这海量数据。iTRAQ(用于相对和绝对定量的同量异位标签)是一种可同时对来自多个样本的蛋白质进行定量的技术。尽管iTRAQ数据为生物学家提供了有用的见解,但由于其多重设计,进行分析并得出生物学结论更为复杂。其中一个问题是寻找在不同时间点之间行为相似(即丰度变化相似)的蛋白质,因为蛋白质组学数据中的时序变化揭示了重要的生物学信息。基于距离的方法(如欧几里得距离或皮尔逊系数)以及聚类技术(如k均值等)无法考虑序列的时序信息。在本文中,我们提出一种线性时间算法,用于在各种iTRAQ时间进程数据中聚类相似模式,而不受其绝对值的影响。该算法称为时序模式挖掘(TPM),它将数据从笛卡尔平面映射到离散二值平面。映射后,动态规划技术允许挖掘在时间上彼此更接近的相似数据元素。所提出的算法以超过99%的准确率精确聚类在时间上彼此更接近的iTRAQ数据。我们从聚类质量、执行时间和大数据集的可扩展性方面分析了不同问题规模的实验结果。最后提供了一个来自我们蛋白质组学数据的示例,以展示该算法的性能及其聚类时序序列的能力,而不受序列间距离的影响。

关键词

引用

@article{arxiv.1104.5510,
  title  = {Mining Temporal Patterns from iTRAQ Mass Spectrometry(LC-MS/MS) Data},
  author = {Fahad Saeed and Trairak Pisitkun and Mark A. Knepper and Jason D. Hoffert},
  journal= {arXiv preprint arXiv:1104.5510},
  year   = {2011}
}

备注

12 pages, 10 figures, The Proceedings of the ISCA 3rd International Conference on Bioinformatics and Computational Biology (BiCoB), pp 152-159 New Orleans, Louisiana, USA, March 23-25, 2011 (ISBN: 978-1-880843-81-9)