中文

GOBench:多模态大语言模型的几何光学生成与理解基准测试

计算机视觉与模式识别 2025-08-06 v2

摘要

多模态大语言模型(MLLMs)的快速发展正在推动视觉理解和生成方面的重大进步。然而,对于它们在细粒度物理原理(尤其是几何光学)方面的能力,仍然缺乏全面的评估。为了填补这一空白,我们引入了 GOBench,这是第一个系统评估 MLLMs 在两项任务上能力的基准:1)生成光学真实的图像,以及 2)理解潜在的光学现象。我们精心策划了高质量的几何光学场景提示,并使用 MLLMs 构建了 GOBench-Gen-1k 数据集。随后,我们组织了主观实验,从光学真实性、美学质量和指令保真度方面评估生成的图像,揭示了 MLLMs 违反光学原理的生成缺陷。对于理解任务,我们应用精心设计的评估指令来测试十一个主流 MLLMs 的光学理解能力。实验结果表明,当前模型在光学生成和理解方面都面临重大挑战。表现最好的生成模型 GPT-4o-Image 无法完美完成所有生成任务,而表现最好的 MLLM 模型 Gemini-2.5Pro 在光学理解方面的准确率仅为 37.35\%。数据库和代码已在 https://github.com/aiben-ch/GOBench 上公开。

关键词

引用

@article{arxiv.2506.00991,
  title  = {GOBench: Benchmarking Geometric Optics Generation and Understanding of MLLMs},
  author = {Xiaorong Zhu and Ziheng Jia and Jiarui Wang and Xiangyu Zhao and Haodong Duan and Xiongkuo Min and Jia Wang and Zicheng Zhang and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2506.00991},
  year   = {2025}
}

备注

8 pages, 5 figures