中文

通过细粒度对齐推进分子图-文本预训练

人工智能 2025-06-02 v5

摘要

理解分子结构及相关知识对科学研究至关重要。近期的研究将分子图与其文本描述相结合,以增强分子表示学习。然而,这些方法侧重于整个分子图,而忽略了频繁出现的子图(即 motif),这些子图对于确定分子性质至关重要。缺乏此类细粒度知识,这些模型难以泛化到需要 motif 级别洞察的未见分子和任务。为了弥补这一差距,我们提出了 FineMolTex,一种新颖的细粒度分子图-文本预训练框架,以联合学习粗粒度的分子级知识和细粒度的 motif 级知识。具体而言,FineMolTex 包含两个预训练任务:用于粗粒度匹配的对比对齐任务和用于细粒度匹配的掩码多模态建模任务。特别地,后者预测基于重要性选择的被掩码 motif 和单词的标签。通过利用来自两种模态的洞察,FineMolTex 能够理解 motif 和单词之间的细粒度匹配。最后,我们在三个下游任务上进行了广泛实验,在基于文本的分子编辑任务中实现了高达 230% 的提升。此外,我们的案例研究表明,FineMolTex 成功捕获了细粒度知识,可能为药物发现和催化剂设计提供有价值的见解。

关键词

引用

@article{arxiv.2409.14106,
  title  = {Advancing Molecular Graph-Text Pre-training via Fine-grained Alignment},
  author = {Yibo Li and Yuan Fang and Mengmei Zhang and Chuan Shi},
  journal= {arXiv preprint arXiv:2409.14106},
  year   = {2025}
}

备注

Accepted by KDD 2025