中文

面向更优模态对齐的跨模态文本-分子检索

信息检索 2024-11-01 v1

摘要

跨模态文本-分子检索模型旨在学习文本和分子模态的共享特征空间,以实现精确的相似度计算,这有助于在药物设计中快速筛选具有特定性质和活性的分子。然而,先前的工作存在两个主要缺陷。首先,考虑到文本序列与分子图之间的显著差异,它们在捕获模态共享特征方面能力不足。其次,它们主要依赖对比学习和对抗训练进行跨模态对齐,这两种方法都侧重于一阶相似性,而忽略了能够捕获嵌入空间中更多结构信息的二阶相似性。为解决这些问题,我们提出了一种具有双重改进的新型跨模态文本-分子检索模型。具体而言,在两个模态特定编码器之上,我们堆叠了一个基于记忆库的特征投影器,该投影器包含可学习的记忆向量,以更好地提取模态共享特征。更重要的是,在模型训练期间,我们为每个实例计算四种相似性分布(文本到文本、文本到分子、分子到分子和分子到文本的相似性分布),然后最小化这些相似性分布之间的距离(即二阶相似性损失),以增强跨模态对齐。实验结果和分析有力地证明了我们模型的有效性。特别是,我们的模型达到了SOTA性能,比先前报道的最佳结果高出6.4%。

关键词

引用

@article{arxiv.2410.23715,
  title  = {Towards Cross-Modal Text-Molecule Retrieval with Better Modality Alignment},
  author = {Jia Song and Wanru Zhuang and Yujie Lin and Liang Zhang and Chunyan Li and Jinsong Su and Song He and Xiaochen Bo},
  journal= {arXiv preprint arXiv:2410.23715},
  year   = {2024}
}

备注

BIBM 2024 regular paper