中文

OlympicArena:面向超级智能 AI 的多学科认知推理基准

计算与语言 2025-03-07 v2 人工智能

摘要

人工智能(AI)的发展显著受益于大型语言模型(LLMs)和大型多模态模型(LMMs)的突破,逐渐展现出在问题解决和科学发现(即 AI4Science)方面的认知推理能力,这些能力曾独占人类智慧。为了全面评估当前模型在认知推理能力方面的表现,我们介绍了 OlympicArena,包含 11,163 个双语问题,涵及纯文本和交错文本-图像两种模态。这些挑战涵盖了跨越七个领域、62 个国际奥林匹克竞技项目的广泛学科,经过严格审核,确保无数据泄露。我们认为,奥林匹克竞技问题的挑战因其复杂性和跨学科性,非常适合评估 AI 的认知推理能力,这对于解决复杂的科学问题和促进发现至关重要。除了仅使用答案准确率来评估不同学科领域的表现外,我们从多个角度进行了详细实验和分析。我们深入探讨了模型的认知推理能力、不同模态下的表现,以及在过程级评估中的结果,这些都是需要进行长时间解答的复杂推理任务所必需的。我们的广泛评估显示,甚至是先进的模型如 GPT-4o 仅实现 39.97% 的整体准确率,说明当前 AI 在复杂推理和多模态集成方面的局限性。通过 OlympicArena,我们旨在推动 AI 向超级智能发展,使其能够解决更复杂的科学问题并促进发现。我们还提供了一整套资源来支持 AI 研究,包括基准数据集、开源标注平台、详细的评估工具以及具有自动提交功能的排行榜。

关键词

引用

@article{arxiv.2406.12753,
  title  = {OlympicArena: Benchmarking Multi-discipline Cognitive Reasoning for Superintelligent AI},
  author = {Zhen Huang and Zengzhi Wang and Shijie Xia and Xuefeng Li and Haoyang Zou and Ruijie Xu and Run-Ze Fan and Lyumanshan Ye and Ethan Chern and Yixin Ye and Yikai Zhang and Yuqing Yang and Ting Wu and Binjie Wang and Shichao Sun and Yang Xiao and Yiyuan Li and Fan Zhou and Steffi Chern and Yiwei Qin and Yan Ma and Jiadi Su and Yixiu Liu and Yuxiang Zheng and Shaoting Zhang and Dahua Lin and Yu Qiao and Pengfei Liu},
  journal= {arXiv preprint arXiv:2406.12753},
  year   = {2025}
}

备注

Accepted by NeurIPS 2024