中文

GIMLET:一种用于基于指令的分子零样本学习的统一图-文本模型

机器学习 2023-10-24 v3 计算与语言 生物大分子

摘要

分子性质预测近年来受到显著关注。主要瓶颈在于昂贵实验导致的标签不足。为缓解此问题并更好地利用文本知识完成任务,本研究探讨了在零样本设定下采用自然语言指令完成分子相关任务的可行性。我们发现现有分子-文本模型在此设定下表现不佳,原因在于对指令处理不足以及图处理能力有限。为克服这些问题,我们提出 GIMLET,它统一了用于图与文本数据的语言模型。通过采用广义位置嵌入,我们的模型无需额外的图编码模块即可扩展以编码图结构和指令文本。GIMLET 还在注意力机制中将图的编码与任务指令解耦,增强了图特征在新任务上的泛化能力。我们构建了一个包含两千多个分子任务的数据集,这些任务带有从任务描述中导出的相应指令。我们在分子任务及指令上预训练 GIMLET,使模型能有效迁移到广泛任务。实验结果表明,GIMLET 在基于指令的零样本学习中显著优于分子-文本基线,甚至在 toxcast 和 muv 等任务上取得了与有监督 GNN 模型接近的结果。

关键词

引用

@article{arxiv.2306.13089,
  title  = {GIMLET: A Unified Graph-Text Model for Instruction-Based Molecule Zero-Shot Learning},
  author = {Haiteng Zhao and Shengchao Liu and Chang Ma and Hannan Xu and Jie Fu and Zhi-Hong Deng and Lingpeng Kong and Qi Liu},
  journal= {arXiv preprint arXiv:2306.13089},
  year   = {2023}
}