利用大语言模型与双任务学习增强化学反应与逆合成预测
机器学习
2025-05-06 v1 人工智能
计算与语言
摘要
化学反应与逆合成预测是药物发现中的基础任务。近年来,大语言模型(LLMs)在诸多领域展现出潜力。然而,将大语言模型直接应用于这些任务面临两大挑战:(i) 缺乏大规模化学合成相关的指令数据集;(ii) 现有微调策略忽略了反应预测与逆合成预测之间的紧密关联。为应对这些挑战,我们提出 ChemDual,一个用于精确化学合成的新型大语言模型框架。具体而言,考虑到反应与逆合成数据获取的高昂成本,ChemDual 将分子的反应与逆合成视为一个相关的重组与断裂过程,并构建了一个包含 440 万条指令的大规模数据集。此外,ChemDual 引入了一个增强型 LLaMA 模型,该模型配备了多尺度分词器和双任务学习策略,以联合优化重组与断裂过程以及反应与逆合成预测任务。在 Mol-Instruction 和 USPTO-50K 数据集上的大量实验表明,ChemDual 在反应预测和逆合成预测方面均达到了最先进的性能,优于现有的传统单任务方法和通用的开源大语言模型。通过分子对接分析,ChemDual 生成的化合物具有多样且强的蛋白质结合亲和力,进一步凸显了其在药物设计中的强大潜力。
引用
@article{arxiv.2505.02639,
title = {Enhancing Chemical Reaction and Retrosynthesis Prediction with Large Language Model and Dual-task Learning},
author = {Xuan Lin and Qingrui Liu and Hongxin Xiang and Daojian Zeng and Xiangxiang Zeng},
journal= {arXiv preprint arXiv:2505.02639},
year = {2025}
}
备注
Accepted for publication at IJCAI 2025