中文

AI 能否验证科学?面向精确科学声明到证据推理的 LLM 基准测试

计算与语言 2025-06-11 v1 人工智能

摘要

大语言模型(LLM)正日益被用于文献综述、思想生成和科学论文分析等复杂研究任务,但它们真正理解并处理复杂研究论文中错综复杂关系(如声明与支持证据之间的逻辑联系)的能力在很大程度上仍未被探索。在本研究中,我们提出了 CLAIM-BENCH,一个用于评估 LLM 在科学声明-证据提取与验证方面能力的综合基准,该任务反映了对科学论证的更深层次理解。我们系统地比较了受分治法启发的三种方法,跨越六个不同的 LLM,突出了模型在科学理解方面的特定优势与弱点。通过在多个研究领域中对超过 300 个声明-证据对进行评估,我们揭示了 LLM 在处理复杂科学内容方面的显著局限性。我们的结果表明,在声明-证据识别任务的精确率和召回率方面,GPT-4 和 Claude 等闭源模型始终优于开源模型。此外,经过策略性设计的三阶段和逐个提示方法显著提高了 LLM 将分散证据与声明准确关联的能力,尽管这伴随着计算成本的增加。CLAIM-BENCH 为评估 LLM 的科学理解能力设定了新标准,既提供了一种诊断工具,也为构建能够在全篇论文上进行更深层次、更可靠推理的系统指明了前进方向。

关键词

引用

@article{arxiv.2506.08235,
  title  = {Can AI Validate Science? Benchmarking LLMs for Accurate Scientific Claim $\rightarrow$ Evidence Reasoning},
  author = {Shashidhar Reddy Javaji and Yupeng Cao and Haohang Li and Yangyang Yu and Nikhil Muralidhar and Zining Zhu},
  journal= {arXiv preprint arXiv:2506.08235},
  year   = {2025}
}

备注

21 pages, 6 figures, Under review