中文

奥林匹克基准:用于推动AGI的奥林匹克水平双语多模态科学问题

计算与语言 2024-06-07 v2

摘要

近期进展表明,大型语言模型(LLM)和大型多模态模型(LMM)在各种任务中超越了一般人类的能力,接近人类专家在多个领域的熟练程度。随着传统基准对这些模型变得不那么具有挑战性,新的严谨挑战日益重要,以衡量它们的先进能力。在本工作中,我们提出了奥林匹克基准(OlympiadBench),这是一个奥林匹克水平双语多模态科学基准,包含来自奥林匹克水平数学和物理比赛(包括中国高考)的8476个问题。每个问题都包含针对分步骤推理的专家级注释。评估顶级模型在奥林匹克基准上的表现,我们实施了一种全面的评估方法来准确评估模型响应。值得注意的是,最佳表现模型GPT-4V在奥林匹克基准上获得了17.97%的平均得分,在物理学部分仅为10.74%,凸显了该基准的严谨性以及物理推理的复杂性。我们将GPT-4V的分析指向了常见的幻觉问题、知识遗漏和逻辑谬误。我们希望这个具有挑战性的基准能为未来的AGI研究提供有价值的资源。数据和评估代码均可在 \url{https://github.com/OpenBMB/OlympiadBench} 获取。

关键词

引用

@article{arxiv.2402.14008,
  title  = {OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems},
  author = {Chaoqun He and Renjie Luo and Yuzhuo Bai and Shengding Hu and Zhen Leng Thai and Junhao Shen and Jinyi Hu and Xu Han and Yujie Huang and Yuxiang Zhang and Jie Liu and Lei Qi and Zhiyuan Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:2402.14008},
  year   = {2024}
}

备注

Accepted by ACL 2024 (main), update