中文

看似认知导向的基准揭示多模态大语言模型中的系统性姿态失效

计算机视觉与模式识别 2026-03-31 v2

摘要

人类逐渐学习物体姿态:从识别物体面向方向、到对其进行心理旋转、再到推理不同物体间的姿态关系。当前的视觉语言基准大致将姿态与位置以及一般场景理解混为一谈。我们引入Discriminative Orientation Reasoning Intelligence (DORI),一个受认知启发的分层基准,使物体姿态成为首要目标。灵感来自人类姿态认知的阶段,DORI将姿态分解为四个维度,每个维度在粗糙(分类)和细粒度(度量)水平上进行评估。由13,652张来自14个来源的图像组成,DORI提供33,656个多选问题,覆盖67类物体,涵盖真实场景和合成场景。其粗到细的设计通过边界框隔离、标准化空间参考系以及结构化提示,隔离了物体识别难度、场景杂乱度和语言歧义等干扰因素。评估24个最先进的视觉语言模型显示,清晰模式:在一般空间基准上表现良好的模型在物体中心姿态任务上几乎随机。最佳模型仅在粗糙任务上达到54.2%,在细粒度任务上仅达45.0%,最大失败 occurs 在复合旋转和跨物体参考系的位移。大幅度的粗到细差距揭示了模型依赖于分类启发式方法而非几何推理,这一局限在现有基准下被掩盖。这一结果确定了姿态理解是多模态系统的一个未解之谜,对机器人操作、3D场景重建以及人机交互具有深远意义。

关键词

引用

@article{arxiv.2603.11410,
  title  = {Seeing Isn't Orienting: A Cognitively Grounded Benchmark Reveals Systematic Orientation Failures in MLLMs Supplementary},
  author = {Nazia Tasnim and Keanu Nichols and Yuting Yang and Nicholas Ikechukwu and Elva Zou and Deepti Ghadiyaram and Bryan A. Plummer},
  journal= {arXiv preprint arXiv:2603.11410},
  year   = {2026}
}

备注

This is a replacement and updated version for submission arXiv:2505.21649 : Right Side Up? Disentangling Orientation Understanding in MLLMs with Fine-grained Multi-axis Perception Tasks