中文

GIT-Mol:融合图、图像与文本的分子科学多模态大语言模型

机器学习 2024-02-07 v3 计算与语言 生物大分子

摘要

大语言模型在自然语言处理中取得重大进展,通过处理分子文本表示催生了分子科学中的创新应用。然而,多数现有语言模型无法捕获具复杂分子结构或图像的丰富信息。本文中,我们引入GIT-Mol,一种集成图、图像与文本信息的多模态大语言模型。为促进多模态分子数据融合,我们提出GIT-Former,一种能将全部模态对齐至统一潜空间的新架构。相较基线,我们在性质预测上取得5%-10%准确率提升,在分子生成有效性上获得20.2%增益。借助任意到语言分子翻译策略,我们的模型有潜力执行更多下游任务,如化合物命名识别与化学反应预测。

关键词

引用

@article{arxiv.2308.06911,
  title  = {GIT-Mol: A Multi-modal Large Language Model for Molecular Science with Graph, Image, and Text},
  author = {Pengfei Liu and Yiming Ren and Jun Tao and Zhixiang Ren},
  journal= {arXiv preprint arXiv:2308.06911},
  year   = {2024}
}

备注

The article has been accepted by Computers in Biology and Medicine, with 14 pages and 4 figures