中文

笛卡尔捷径:在极坐标空间中重新评估视觉推理

计算机视觉与模式识别 2026-05-12 v1 人工智能

摘要

随着当前多模态大语言模型迅速饱和典型的视觉推理基准,一个关键问题浮现:这些高分是否真正反映了稳健的视觉理解?我们识别出一种普遍存在的脆弱性,即 \textbf{笛卡尔捷径}:视觉推理基准普遍建立在可轻易离散化为显式文本坐标的正交网格布局之上。模型系统性地利用这一属性,严重依赖基于文本的演绎推理来辅助视觉问题求解。为了系统性消除这一捷径,我们引入了 \textbf{Polaris-Bench},它在极坐标空间中重新构建了 53 个视觉推理任务,并以配对的笛卡尔对应任务作为参考,同时保持一致的逻辑约束和任务语义——从而从根本上打破了模型所利用的正交先验。对 1414 个最先进 MLLM 的全面评估表明,在笛卡尔布局上取得 7070--83%83\% 分的前沿模型在极坐标等效任务上骤降至 3131--39%39\%,即使在完全逻辑等价的情况下退化依然存在。此外,在笛卡尔布局上观察到的推理增益在极坐标等效任务上大幅缩减。这些发现揭示了当前 MLLM 的一个关键缺陷:缺乏拓扑不变的视觉推理。

关键词

引用

@article{arxiv.2605.09883,
  title  = {The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space},
  author = {Xia Hu and Zhenrui Yue and Brian Potetz and Howard Zhou and Leonidas Guibas and Chun-Ta Lu and Zhicheng Wang},
  journal= {arXiv preprint arXiv:2605.09883},
  year   = {2026}
}