探索基于最优传输的多粒度对齐在文本-分子检索中的应用
信息检索
2024-11-20 v1 人工智能
计算与语言
生物大分子
摘要
生物信息学领域取得了显著进展,使得跨模态文本-分子检索任务日益重要。该任务侧重于基于文本描述准确检索分子结构,通过有效对齐文本描述与分子来协助研究人员识别合适的分子候选物。然而,许多现有方法忽略了分子子结构中固有的细节。在本工作中,我们引入了基于最优传输的多粒度对齐模型(ORMA),这是一种促进文本描述与分子间多粒度对齐的新方法。我们的模型包含一个文本编码器和一个分子编码器。文本编码器处理文本描述以生成词元级和句子级表示,而分子被建模为分层异构图,包含原子、模体和分子节点以提取这三个层级的表示。ORMA 的一个关键创新是应用最优传输(OT)将词元与模体对齐,生成整合了多个词元与其对应模体对齐的多词元表示。此外,我们采用对比学习在三个不同尺度上细化跨模态对齐:词元-原子、多词元-模体和句子-分子,确保正确匹配的文本-分子对之间的相似度最大化,而不匹配对之间的相似度最小化。据我们所知,这是首次尝试在模体和多词元层级探索对齐。在 ChEBI-20 和 PCdes 数据集上的实验结果表明,ORMA 显著优于现有的最先进(SOTA)模型。
引用
@article{arxiv.2411.11875,
title = {Exploring Optimal Transport-Based Multi-Grained Alignments for Text-Molecule Retrieval},
author = {Zijun Min and Bingshuai Liu and Liang Zhang and Jia Song and Jinsong Su and Song He and Xiaochen Bo},
journal= {arXiv preprint arXiv:2411.11875},
year = {2024}
}
备注
BIBM 2024 Regular Paper