中文

JESTR:面向无目标代谢组数据注释的联合嵌入空间排序候选分子技术

定量方法 2025-06-10 v3 人工智能 机器学习 生物大分子

摘要

动机:代谢组注释是一个主要挑战,即将分子结构分配给质谱片段模式。尽管近期在分子-谱和谱-分子指纹预测方面取得了进展,但注释率仍然较低。结果:本文引入了一种新范式(JESTR),用于注释。与以往方法不同,JESTR利用分子及其对应谱图是同一数据的同一视图这一洞见,有效地将其表示嵌入到联合空间。候选结构基于查询谱图与每个候选分子嵌入之间余弦相似度进行排序。我们在三个数据集上对JESTR与分子-谱和谱-指纹注释工具进行评估。结果表明,JESTR在rank@[1-5]方面平均优于其他工具23.6%-71.6%。我们进一步证明,在训练期间对候选分子进行正则化具有强大的价值,通过提升rank@1性能11.4%,增强了模型区分目标分子和候选分子的能力。在将JESTR的性能与MassSpecGym基准数据集子集上公开可用的SIRIUS和CFM-ID预训练模型进行比较时,JESTR分别以31%和238%的优势获胜。通过JESTR,我们提供了一条通往准确注释的新型前景路径,从而解锁了对代谢组中宝贵洞见。

关键词

引用

@article{arxiv.2411.14464,
  title  = {JESTR: Joint Embedding Space Technique for Ranking Candidate Molecules for the Annotation of Untargeted Metabolomics Data},
  author = {Apurva Kalia and Yan Zhou Chen and Dilip Krishnan and Soha Hassoun},
  journal= {arXiv preprint arXiv:2411.14464},
  year   = {2025}
}

备注

10 pages, 10 figures, 4 tables