在生物医学与多领域语境下评估大语言模型成对因果发现能力
计算与语言
2026-03-13 v1 人工智能
摘要
在大语言模型(LLM)安全部署于生物医学等高风险领域之前,要求其具备因果推理能力。我们通过在一项基础任务——从文本中进行成对因果发现(PCD)上测试13个开源LLM来考察这一能力。我们的基准测试使用12个多样化数据集,评估两项核心技能:1)\textbf{因果检测}(识别文本是否包含因果联系)和2)\textbf{因果抽取}(提取确切的因果短语)。我们测试了多种提示方法,从简单指令(零样本)到思维链(CoT)和少样本上下文学习(FICL)等更复杂的策略。结果显示当前模型存在重大缺陷。检测表现最佳的模型 DeepSeek-R1-Distill-Llama-70B 仅获得 49.57\% () 的平均分,而抽取表现最佳的模型 Qwen2.5-Coder-32B-Instruct 仅达到 47.12\% ()。模型在简单、显式、单句关系上表现最佳。然而,在更困难(且更贴近现实)的情况下,例如隐式关系、跨句联系以及包含多个因果对的文本,性能急剧下降。我们提供了一个基于高标注者间一致性()数据集构建的统一评估框架,并公开所有数据、代码和提示以促进进一步研究。\href{https://github.com/sydneyanuyah/CausalDiscovery}{代码在此:https://github.com/sydneyanuyah/CausalDiscovery}
引用
@article{arxiv.2601.15479,
title = {Benchmarking LLMs for Pairwise Causal Discovery in Biomedical and Multi-Domain Contexts},
author = {Sydney Anuyah and Sneha Shajee-Mohan and Ankit-Singh Chauhan and Sunandan Chakraborty},
journal= {arXiv preprint arXiv:2601.15479},
year = {2026}
}