中文

HumanPCR: 探索 MLLM 在多样人类场景中的能力

计算机视觉与模式识别 2025-08-20 v1

摘要

受多模态模型快速进步的驱动,人工通用智能的理想愿景需要在多样化环境中实现人类水平的性能。我们提出了 HumanPCR,这是一套用于探测大语言多模态模型 (MLLM) 在人类相关视觉情境中能力的评估套件,其覆盖三个层次的能力评估:感知 (Human-P)、理解 (Human-C) 和推理 (Human-R)。Human-P 和 Human-C 包含超过 6000 个经人类验证的多选题,评估包括但不限于现有基准常忽视的九项关键技能。Human-R 提供一个具有挑战性的、由人类专家精选的视频推理测试,要求整合多个视觉证据,主动提取问题线索之外的上下文,并应用类似人类的专业知识。每个问题都包含人类标注的链式思维 (Chain-of-Thought, CoT) 理由,并指出关键视觉证据以支持进一步的研究。对 30 多款最先进模型进行大规模评估,显示出在人类中心的视觉理解方面存在显著挑战,尤其是在涉及细致空间感知、时序理解和心智建模的任务中。此外,对 Human-R 的分析揭示了模型在从多样化的人类场景中提取关键主动视觉证据方面的困难,以及它们错误地依赖查询引导的检索。即使采用规模化视觉情境和测试时思考等先进技术,也仅能带来有限的益处。我们希望 HumanPCR 及其发现能够推动多模态模型的发展、评估以及人类中心的应用。

关键词

引用

@article{arxiv.2508.13692,
  title  = {HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes},
  author = {Keliang Li and Hongze Shen and Hao Shi and Ruibing Hou and Hong Chang and Jie Huang and Chenghao Jia and Wen Wang and Yiling Wu and Dongmei Jiang and Shiguang Shan and Xilin Chen},
  journal= {arXiv preprint arXiv:2508.13692},
  year   = {2025}
}