InfiniteScienceGym:用于科学分析的无界、程序生成基准
计算与语言
2026-04-16 v1 人工智能
摘要
大型语言模型正作为科学助手出现,但评估其从经验数据中推理的能力仍具挑战。源自已发表研究和人工标注的基准继承出版偏差、已知知识偏差、标签噪声以及 substantial存储需求。我们提出InfiniteScienceGym,一个程序生成的科学数据存储库基准,搭配可验证的问答任务。从种子开始,模拟器确定性地生成一个自包含的数据存储库,包括真实的文件目录结构、文件和表格数据,以及具备可验证答案的问答生成器,既生成可回答问题也生成不可回答问题,并具有精确的ground truth。这使得在不分发大型静态语料库的情况下评估证据导向推理、驳回和工具中介分析。InfiniteScienceGym补充现实科学基准,旨在针对使用已发表数据集难以评估的盲点和失效模式。评估了专有和开源权重模型,我们发现没有模型整体准确率超过45%,识别不可回答问题仍是主要弱点,更强的模型倾向于更有效地使用工具而非仅仅消耗更多token。
引用
@article{arxiv.2604.13201,
title = {InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis},
author = {Oliver Bentham and Vivek Srikumar},
journal= {arXiv preprint arXiv:2604.13201},
year = {2026}
}