中文

SciIF:面向严谨科学智能的科学指令遵循基准测试

人工智能 2026-01-13 v2 数据库

摘要

随着大语言模型(LLM)从通用知识检索向复杂科学发现过渡,其评估标准也必须纳入科学探究的严谨规范。现有基准测试存在一个关键盲点:通用指令遵循指标侧重于表面格式,而特定领域的科学基准仅评估最终答案的正确性,往往奖励那些以错误理由得出正确结果的模型。为弥补这一不足,我们引入了科学指令遵循(scientific instruction following):在解决问题的同时严格遵守确立科学有效性的约束条件的能力。具体而言,我们引入了 SciIF,这是一个多学科基准测试,通过将大学级别的问题与固定约束目录相结合来评估该能力,约束涵盖三大支柱:科学条件(如边界检查和假设)、语义稳定性(如单位和符号约定)以及特定过程(如所需的数值方法)。独特的是,SciIF 强调可审计性,要求模型提供满足约束的明确证据,而非隐式合规。通过同时衡量解答正确性和多约束遵循度,SciIF 能够对组合推理失败进行细粒度诊断,确保 LLM 能够在严格的科学逻辑框架内作为可靠的智能体运行。

关键词

引用

@article{arxiv.2601.04770,
  title  = {SciIF: Benchmarking Scientific Instruction Following Towards Rigorous Scientific Intelligence},
  author = {Encheng Su and Jianyu Wu and Chen Tang and Lintao Wang and Pengze Li and Aoran Wang and Jinouwen Zhang and Yizhou Wang and Yuan Meng and Xinzhu Ma and Shixiang Tang and Houqiang Li},
  journal= {arXiv preprint arXiv:2601.04770},
  year   = {2026}
}