用于基于文本的检索与编辑的多模态分子结构-文本模型
机器学习
2024-01-31 v3 计算与语言
定量方法
机器学习
摘要
人工智能在药物发现中的采用日益增多。然而,现有研究主要利用分子的化学结构而忽略化学中大量可用的文本知识。引入文本知识使我们能够实现新的药物设计目标、适应基于文本的指令并预测复杂的生物活性。在此,我们提出一种多模态分子结构-文本模型 MoleculeSTM,通过对比学习策略联合学习分子的化学结构与文本描述。为训练 MoleculeSTM,我们构建了名为 PubChemSTM 的大型多模态数据集,包含超过 280,000 个化学结构-文本对。为展示 MoleculeSTM 的有效性与实用性,我们基于文本指令设计了两项具挑战性的零样本任务,包括结构-文本检索与分子编辑。MoleculeSTM 具有两项主要特性:基于自然语言的开放词表与组合性。实验中,MoleculeSTM 在各种基准上获得了对新颖生化概念的最优泛化能力。
引用
@article{arxiv.2212.10789,
title = {Multi-modal Molecule Structure-text Model for Text-based Retrieval and Editing},
author = {Shengchao Liu and Weili Nie and Chengpeng Wang and Jiarui Lu and Zhuoran Qiao and Ling Liu and Jian Tang and Chaowei Xiao and Anima Anandkumar},
journal= {arXiv preprint arXiv:2212.10789},
year = {2024}
}