MolCA:基于跨模态投影器与单模态适配器的分子图-语言建模
计算与语言
2024-01-19 v4 多媒体
摘要
语言模型(LMs)已在各种一维文本相关任务上展现出令人印象深刻的分子理解能力。然而,它们天生缺乏二维图感知能力——这是人类专业人员理解分子拓扑结构的关键能力。为弥补这一差距,我们提出 MolCA:基于跨模态投影器与单模态适配器的分子图-语言建模。MolCA 通过跨模态投影器使 LM(如 Galactica)能够理解基于文本和基于分子的图内容。具体而言,跨模态投影器实现为 Q-Former,用于连接图编码器的表示空间与 LM 的文本空间。此外,MolCA 采用单模态适配器(即 LoRA)以实现 LM 对下游任务的高效适配。与以往通过跨模态对比学习将 LM 与图编码器耦合的研究不同,MolCA 保留了 LM 的开放式文本生成能力,并以其增强了二维图信息。为展示其有效性,我们在分子描述生成、IUPAC 命名预测和分子-文本检索任务上广泛基准测试了 MolCA,其在这些任务上显著优于基线。我们的代码和检查点可在 https://github.com/acharkq/MolCA 找到。
引用
@article{arxiv.2310.12798,
title = {MolCA: Molecular Graph-Language Modeling with Cross-Modal Projector and Uni-Modal Adapter},
author = {Zhiyuan Liu and Sihang Li and Yanchen Luo and Hao Fei and Yixin Cao and Kenji Kawaguchi and Xiang Wang and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2310.12798},
year = {2024}
}
备注
EMNLP main conference. 9 pages