中文

LiveK12Bench:大型多模态模型真的征服了高中水平考试吗?

人工智能 2026-05-27 v1 多媒体

摘要

先进的大型多模态模型在K-12推理任务中展现了令人印象深刻的性能,显示出作为智能导师的巨大潜力。实现这一潜力需要模型能够有效地应对真实世界的考试,然而大多数现有基准测试未能捕捉到真实测试环境的复杂性。具体来说,大多数数据集是静态的,容易受到数据污染,并且通常局限于受限的模态、学科和评估标准。为了解决这些问题,我们引入了LiveK12Bench,这是一个动态、全面、多学科的基准测试,旨在评估大型多模态模型在真实考试场景中的推理能力。LiveK12Bench包含2000多道经过验证的题目,涵盖数学、物理、化学和生物学,这些题目来自最新的真实考试试卷,并设计为随时间增长。我们的框架具有几个核心创新:1)采用自动化流水线,持续摄入和解析最新的考试试卷以减轻数据泄露;2)提出了一种新颖的“模拟考试”评估方案,该方案评估模型以准确高效的推理路径自主完成端到端考试的能力。在12个大型多模态模型上进行的大量实验表明,在考试真实的约束条件下,先进模型的性能会大幅下降:当同时评估过程严谨性和效率时,GPT-5的得分从79分(满分100分)下降到53分。我们的发现揭示了关键的脆弱性,例如对复杂视觉布局的敏感性,凸显了理想化推理能力与真实教育准备度之间的差距。代码和数据集均已公开。

关键词

引用

@article{arxiv.2605.26781,
  title  = {LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?},
  author = {Xiaohan Wang and Mingze Yin and Yilin Zhao and Gang Liu and Dian Li},
  journal= {arXiv preprint arXiv:2605.26781},
  year   = {2026}
}