质谱数据挖掘:度量嵌入与快速近邻搜索
定量方法
2007-05-23 v1 其他定量生物学
摘要
挖掘大规模高通量串联质谱数据集是基于质谱的蛋白质鉴定中的一个非常重要的问题。大规模质谱挖掘的基本问题之一是设计适当的度量和算法以避免光谱的两两比较。在本文中,我们提出了一种基于向量空间的通用框架以避免两两比较。我们首先以新颖方式将光谱鲁棒地嵌入高维空间,然后应用快速近似近邻算法来执行诸如构建数据库搜索过滤器、索引和相似性搜索等任务。我们形式化地证明,与余弦相似度相比我们的嵌入具有低失真,并且结合局部敏感哈希(LSH),我们设计了数据库搜索过滤器,可过滤掉超过 98.9% 的肽段(减少 118 倍)而最多漏掉 0.29% 的正确序列。然后我们展示了我们的框架如何用于相似性搜索,其可用于检测紧密簇或重复项。平均而言,对于 16 个光谱的簇大小,LSH 仅漏掉 1 个光谱并误纳仅 1 个虚假光谱。此外,我们的框架结合降维技术使我们能够在 2D 空间中可视化大型数据集。我们的框架还有潜力嵌入和比较具有翻译后修饰(PTM)的数据集。
引用
@article{arxiv.q-bio/0603002,
title = {Mining Mass Spectra: Metric Embeddings and Fast Near Neighbor Search},
author = {Debojyoti Dutta and Ting Chen},
journal= {arXiv preprint arXiv:q-bio/0603002},
year = {2007}
}
备注
Computational Proteomics, Mass Spectrometry