以大型语言模型赋能分子-说明文本翻译中的分子发现:ChatGPT 视角
计算与语言
2024-05-10 v2 人工智能
摘要
分子发现在诸多科学领域中起着关键作用,推动了定制化材料与药物的设计。然而,现有大多数方法严重依赖领域专家、需要过高的计算成本,或存在次优性能。另一方面,大型语言模型 (LLMs)(如 ChatGPT)凭借其在自然语言理解、泛化与上下文学习 (ICL) 方面的强大能力,在各种跨模态任务中展现出卓越性能,为推进分子发现提供了前所未有的机遇。尽管已有若干前期工作尝试将 LLMs 应用于该任务,但缺乏领域专用语料以及训练专用 LLMs 的困难仍是挑战。本文提出一种基于 LLM 的新型框架 (MolReGPT) 用于分子-说明文本翻译,其中引入上下文少样本分子学习范式,使 ChatGPT 等 LLM 无需领域专用预训练与微调即可发挥上下文学习能力,从而赋能分子发现。MolReGPT 利用分子相似性原理从本地数据库检索相似分子及其文本描述,使 LLM 能从上下文示例中学习任务知识。我们在分子-说明文本翻译(包括分子理解与基于文本的分子生成)上评估了 MolReGPT 的有效性。实验结果表明,与微调模型相比,MolReGPT 优于 MolT5-base 且与 MolT5-large 相当,且无需额外训练。据我们所知,MolReGPT 是首个通过上下文学习利用 LLM 于分子-说明文本翻译以推进分子发现的工作。我们的工作拓展了 LLM 的应用范围,也为分子发现与设计提供了新范式。
引用
@article{arxiv.2306.06615,
title = {Empowering Molecule Discovery for Molecule-Caption Translation with Large Language Models: A ChatGPT Perspective},
author = {Jiatong Li and Yunqing Liu and Wenqi Fan and Xiao-Yong Wei and Hui Liu and Jiliang Tang and Qing Li},
journal= {arXiv preprint arXiv:2306.06615},
year = {2024}
}
备注
Accepted by IEEE TKDE. Our implementation is available at: https://github.com/phenixace/MolReGPT