中文

GraphT5:通过多模态跨标记注意力实现统一的分子图-语言建模

机器学习 2025-03-12 v1 人工智能

摘要

分子语言建模任务,如分子描述,已被认识到具有进一步理解分子性质的潜力,这些性质可以辅助基于化学反应的药物发现或材料合成。与通常使用分子图预测分子性质不同,大多数分子语言建模方法严重依赖SMILES序列。这是因为该任务涉及使用基于Transformer的模型生成多个标记的序列。因此,一个主要挑战是确定如何将包含分子结构和空间信息的图数据与文本数据集成。此外,在不解决两种分子表示模态如何对齐和表示分子结构的情况下,简单地将1D SMILES文本和2D图同时用作输入,使得难以充分利用关于分子的结构知识。为此,我们提出了GraphT5,一个多模态框架,将分子的1D SMILES文本和2D图表示集成用于分子语言建模。具体而言,我们在GraphT5中引入了一种新颖的跨标记注意力模块,以弥合两种分子表示模态之间根本差异造成的鸿沟。跨标记注意力利用SMILES与分子图之间在细粒度标记层面的交互所产生的隐含信息,从而有利于分子语言建模。包括分子描述、IUPAC名称预测任务和案例研究在内的广泛实验表明,我们的GraphT5超越了最新的基线方法,这验证了GraphT5在充分利用1D SMILES文本和2D图表示方面的有效性。

关键词

引用

@article{arxiv.2503.07655,
  title  = {GraphT5: Unified Molecular Graph-Language Modeling via Multi-Modal Cross-Token Attention},
  author = {Sangyeup Kim and Nayeon Kim and Yinhua Piao and Sun Kim},
  journal= {arXiv preprint arXiv:2503.07655},
  year   = {2025}
}