DrugReasoner:基于推理增强语言模型的可解释药物批准预测
机器学习
2026-02-18 v2 人工智能
定量方法
摘要
药物发现是一个复杂且资源密集的过程,使得对批准结果的早期预测对于优化研究投资至关重要。虽然经典机器学习和深度学习方法在药物批准预测方面显示出前景,但其有限的可解释性限制了其影响。本文提出了 DrugReasoner,一个基于 LLaMA 架构构建的推理型大语言模型(LLM),通过组相对策略优化(GRPO) 微调以预测小分子批准的可能性。DrugReasoner 将分子描述符与针对结构相似的已批准和未批准化合物进行比较推理,生成预测结果及其逐步理由和置信度分数。DrugReasoner 在验证集上实现了 AUC 为 0.732、F1 为 0.729 的稳健性能,在测试集上分别为 0.725 和 0.718。这些结果超越了逻辑回归、支持向量机和 k 近邻等传统基线方法,并且相对于 XGBoost 具有竞争性能。在外部独立数据集上,DrugReasoner 不仅超越了基线方法和最近开发的 ChemAP 模型,还实现了 AUC 为 0.728、F1 为 0.774,同时保持高精度和平衡灵敏度,展示了在实际场景中的鲁棒性。这些发现表明,DrugReasoner 不仅提供竞争的预测准确率,还通过其推理输出增强了透明度,从而解决了 AI 辅助药物发现中的关键瓶颈。本研究凸显了推理增强 LLM 作为可解释且有效的制药决策工具的潜力。
引用
@article{arxiv.2508.18579,
title = {DrugReasoner: Interpretable Drug Approval Prediction with a Reasoning-augmented Language Model},
author = {Mohammadreza Ghaffarzadeh-Esfahani and Ali Motahharynia and Nahid Yousefian and Navid Mazrouei and Jafar Ghaisari and Yousof Gheisari},
journal= {arXiv preprint arXiv:2508.18579},
year = {2026}
}
备注
13 pages, 2 figures. Corresponding author: [email protected] Kaggle notebook: https://www.kaggle.com/code/mohammadgh009/drugreasoner