大语言模型理解药物作用机制的水平:知识与推理评估数据集
计算与语言
2025-11-11 v1
摘要
显示出对预训练大型语言模型(LLM)日益增长的兴趣的两个科学领域分别是药物开发/再定位和个性化医疗。对于这两个领域,LLM必须展示事实知识以及对药物作用机制的深入理解,以便在新情境下回想和推理相关知识。药物作用机制被描述为生物医学实体之间的一系列相互作用,这些相互作用交织成一个或多个从药物指向被治疗疾病的链。将链中相互作用的效果组合起来,导致对药物是否可能对该疾病有用进行推断。我们引入了一个评估LLM在已知机制的事实知识以及其在 novel 情境下推理能力的数据集,这些情境以模型在训练期间不太可能看到的情形呈现为反事实情形。使用该数据集,我们展示o4-mini在OpenAI的4o、o3和o3-mini模型以及最近的小型Qwen3-4B-thinking模型方面表现优异,后者在某些情况下甚至超过o4-mini。我们证明,对于需要模型回想相关知识的开放世界推理任务,要比那些在所需事实知识被提供给模型的封闭世界推理情境要具备更大的挑战性。我们还显示,影响推理链中内部链接的反事实情形,要比影响提示中提到的药物链接的反事实情形困难得多。
引用
@article{arxiv.2511.06418,
title = {How Well Do LLMs Understand Drug Mechanisms? A Knowledge + Reasoning Evaluation Dataset},
author = {Sunil Mohan and Theofanis Karaletsos},
journal= {arXiv preprint arXiv:2511.06418},
year = {2025}
}
备注
An earlier version of this paper appears in IEEE FLLM 2025. GitHub: https://github.com/czi-ai/DrugMechCounterfactuals