SciArena:用于非可验证科学文献基任务的开放评估平台
计算与语言
2026-01-23 v2 人工智能
摘要
我们提出SciArena,这是一个用于评估基础模型在科学文献基任务上的开放性和协作性平台。与传统的科学文献理解与综述基准不同,SciArena直接邀请研究社区参与,遵循Chatbot Arena评估方法,通过社区投票来比较模型。通过利用集体智慧,SciArena为在开放性科学任务上进行社区驱动的模型性能评估提供了可能,这些任务需要基于文献的长篇回答。该平台目前支持47个基础模型,已收集来自不同科学领域的人类研究员的20,000多份投票。对迄今为止收集的数据进行分析确认了其高质量。我们基于模型排行榜讨论结果与见解。为进一步推动构建基于模型的自动化文献任务评估系统的研究,我们发布SciArena-Eval,这是一个基于收集的偏好数据构建的元评估基准。它衡量模型在通过比较它们的两两评估与人类投票之间,对答案质量判断准确性。我们的实验突显了该基准的挑战,并强调了需要更可靠自动化评估方法的必要性。
引用
@article{arxiv.2507.01001,
title = {SciArena: An Open Evaluation Platform for Non-Verifiable Scientific Literature-Grounded Tasks},
author = {Yilun Zhao and Kaiyan Zhang and Tiansheng Hu and Sihong Wu and Ronan Le Bras and Charles McGrady and Taira Anderson and Jonathan Bragg and Joseph Chee Chang and Jesse Dodge and Matt Latzke and Yixin Liu and Xiangru Tang and Zihang Wang and Chen Zhao and Hannaneh Hajishirzi and Doug Downey and Arman Cohan},
journal= {arXiv preprint arXiv:2507.01001},
year = {2026}
}
备注
NeurIPS 2025 Datasets & Benchmarks Track (Spotlight)