中文

人类对齐基准:细粒度评估 MLLMs 与人类的推理能力

计算机视觉与模式识别 2025-05-27 v2 人工智能

摘要

实现人工通用智能(AGI)的目标是模仿人类并超越人类。如 OpenAI 的 o1、o3 和 DeepSeek 的 R1 等模型已展示出具备人类水平推理能力的大语言模型(LLM)在多模态大语言模型(MLLM)中的卓越表现,并正在逐步集成到实际应用中。然而,这些模型在处理推理任务方面是否具备与人类相当的能力目前尚不明确。本文提出了 Human-Aligned Bench,这是一个用于细粒度对齐多模态推理与人类性能的基准测试。具体而言,我们收集了 9,794 个仅依赖上下文推理的多模态问题,包括中英双语多模态问题和纯文本问题,涵盖四种问题类型:视觉推理、定义判断、类比推理和逻辑判断。更重要的是,每个问题都伴随人类成功率以及人类容易选择错误的选项。对 Human-Aligned Bench 上大规模实验结果表明,当前 MLLMs 在多模态推理方面的表现与人类之间存在显著差异。本基准的发现为下一代模型的开发提供了洞见。

关键词

引用

@article{arxiv.2505.11141,
  title  = {Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans},
  author = {Yansheng Qiu and Li Xiao and Zhaopan Xu and Pengfei Zhou and Zheng Wang and Kaipeng Zhang},
  journal= {arXiv preprint arXiv:2505.11141},
  year   = {2025}
}