中文

看并非导向:认知导向基准揭示 MLLMs 中的系统性姿态失败

计算机视觉与模式识别 2026-04-28 v7

摘要

对象姿态理解是视觉感知中的基本挑战,对机器人操作和增强现实等应用至关重要。当前的视觉语言基准未能孤立这一能力,常将其与位置关系和一般场景理解混为一谈。我们引入 DORI(Discriminative Orientation Reasoning Intelligence),建立对象姿态感知为主要评估目标的全面基准。DORI 评估姿态理解的四个维度:正面对齐、旋转变换、相对方向关系和规范姿态理解。通过来自 11 个数据集、涵盖 67 个对象类别的经筛选任务(包括合成和真实场景),DORI 为多模态系统理解对象姿态提供了洞见。我们评估了 15 个最先进的视觉语言模型,发现即使是最好的模型在粗糙任务上也仅达到 54.2% 的准确率,在细粒度姿态判断上仅为 33.0%,且在需要参考坐标系转换或复合旋转的任务中表现恶化。这些发现表明需要专门的姿态表示机制,因为模型显示出系统性无法进行精确角度估计、跟踪不同视点下的姿态变化以及理解复合旋转的能力——这表明其内部 3D 空间表示存在局限。作为首个专为多模态系统的姿态意识设计的诊断框架,DORI 为改进机器人控制、3D 场景重建和人机在物理环境中的交互提供了意义。DORI 数据:https://huggingface.co/datasets/appledora/DORI-Benchmark

关键词

引用

@article{arxiv.2505.21649,
  title  = {Seeing Isn't Orienting: A Cognitively Grounded Benchmark Reveals Systematic Orientation Failures in MLLMs},
  author = {Nazia Tasnim and Keanu Nichols and Yuting Yan and Nicholas Ikechukwu and Elva Zou and Deepti Ghadiyaram and Bryan A. Plummer},
  journal= {arXiv preprint arXiv:2505.21649},
  year   = {2026}
}

备注

Previously this version appeared as arXiv:2603.11410 which was submitted as a new work by accident, updated affiliation for one author