中文

大型视觉语言模型的多维人类感知与推理基准

计算机视觉与模式识别 2026-05-06 v1 人工智能

摘要

多维人类理解是诸如电影分析和虚拟数字人等实际应用中必不可少的能力,而当前的 LVLM 基准大多聚焦于单任务设置,缺乏细粒度且以人类为中心的评估。本工作引入 MHPR,一个涵盖 individual、multi-person 和 human-object interaction 三个维度的联合感知-推理人类场景基准。MHPR 包含多层次数据设计——C-RD (标注原始数据)、SFT-D (监督微调数据)、RL-D (强化学习数据) 和 T-D (测试数据)——以及一个自动 caption/VQA 生成管道 (ACVG),通过类别级属性分解、属性特定重写和多模型投票确保高质量、可扩展的注释。我们对 state-of-the-art 视觉语言模型在细粒度属性 (外观、服装、姿态、部件) 和高层次语义 (社交关系、动作语义、空间关系、意图和功能) 上的表现进行评估。我们的发现表明:1) 格式对齐的 SFT 数据显著提高指令遵循和稳定性;2) 以差异案例分析为基础的挑战导向 RL 数据进一步提升了在困难实例上的感知与推理能力;3) 使用 MHPR 训练的 Qwen2.5-VL-7B 模型取得显著提升,接近甚至超过了显著更大规模的模型。我们发布 ACVG 和 MHPR 以促进以人类为中心的感知与推理的可重复、可扩展研究。

关键词

引用

@article{arxiv.2605.03485,
  title  = {MHPR: Multidimensional Human Perception and Reasoning Benchmark for Large Vision-Languate Models},
  author = {Kangkang Wang and Qinting Jiang and Wanping Zhang and Bowen Ren and Shengzhao Wen},
  journal= {arXiv preprint arXiv:2605.03485},
  year   = {2026}
}