HiSciBench:从阅读到发现科学智能的分层多学科基准
人工智能
2025-12-30 v1 计算机视觉与模式识别
摘要
大型语言模型(LLMs)和多模态基础模型的快速发展激发了人们对其在科学研究潜力的浓厚兴趣。然而,科学智能涵盖了从理解基础知识到进行创造性发现的广泛能力,而现有的基准仍然较为碎片化。大多数基准侧重于狭窄的任务,未能反映真实科学探究的分层和多学科性质。我们引入了 \textbf{HiSciBench},这是一个分层基准,旨在评估基础模型在反映完整科学工作流的五个级别上的能力:\textit{科学素养} (L1)、\textit{文献解析} (L2)、\textit{基于文献的问答} (L3)、\textit{文献综述生成} (L4) 和 \textit{科学发现} (L5)。HiSciBench 包含 8,735 个精心策划的实例,涵盖六个主要科学学科,包括数学、物理学、化学、生物学、地理学和天文学,并支持包括文本、方程、图表和表格在内的多模态输入,以及跨语言评估。与以往评估孤立能力的基准不同,HiSciBench 提供了一个集成的、具有依赖感知的框架,能够对模型在科学推理不同阶段的能力进行详细诊断。对包括 GPT-5、DeepSeek-R1 和多个多模态系统在内的领先模型的综合评估揭示了巨大的性能差距:虽然模型在基础素养任务上的准确率高达 69%,但在发现级挑战上的性能急剧下降至 25%。HiSciBench 为评估科学智能建立了新标准,并为开发不仅更强大而且更可靠的模型提供了可操作的见解。该基准将公开发布以促进未来的研究。
引用
@article{arxiv.2512.22899,
title = {HiSciBench: A Hierarchical Multi-disciplinary Benchmark for Scientific Intelligence from Reading to Discovery},
author = {Yaping Zhang and Qixuan Zhang and Xingquan Zhang and Zhiyuan Chen and Wenwen Zhuang and Yupu Liang and Lu Xiang and Yang Zhao and Jiajun Zhang and Yu Zhou and Chengqing Zong},
journal= {arXiv preprint arXiv:2512.22899},
year = {2025}
}