中文

MLLM 是否表现出类人感知行为?HVSBench:用于评估 MLLM 与人类感知行为对齐的基准

计算机视觉与模式识别 2025-12-18 v3

摘要

尽管多模态大语言模型(MLLMs)在众多视觉任务中表现出色,但它们是否表现出类人感知行为尚不清楰。为评估这一问题,我们引入 HVSBench,这是一个规模庞大的基准测试,包含超过 85,000 个样本,用于测试 MLLM 与人类视觉系统(HVS)的对齐程度。该基准覆盖 13 个类别,涵盖 5 个关键领域:显著性、快速计数、优先级、自由观察和搜索。在我们的全面评估中,发现存在显著的感知差距:即使是最先进的 MLLM 也仅取得中等成绩。相比之下,人类参与者表现出强大的性能,显著优于所有模型。这凸显了 HVSBench 的高质量以及需要更贴近人类的 AI。我们相信我们的基准将是开发下一代可解释 MLLM 的关键工具。

关键词

引用

@article{arxiv.2412.09603,
  title  = {Do MLLMs Exhibit Human-like Perceptual Behaviors? HVSBench: A Benchmark for MLLM Alignment with Human Perceptual Behavior},
  author = {Jiaying Lin and Shuquan Ye and Dan Xu and Wanli Ouyang and Rynson W. H. Lau},
  journal= {arXiv preprint arXiv:2412.09603},
  year   = {2025}
}

备注

Project page: https://jiaying.link/HVSBench/