中文

为何 MLLMs 难以确定物体姿态

计算机视觉与模式识别 2026-04-16 v1

摘要

多模态大型语言模型 (MLLMs) 在需要对 2D 物体姿态进行推理的任务中表现不佳,这一现象在 prior work 中已有所述。Tong 等人和 Nichols 等人假设,这些失败源于视觉编码器,因为常用的编码器如 CLIP 和 SigLIP 是为图像-文本语义对齐而训练的,而非用于几何推理。我们设计了一种受控经验协议,以测试此假设,通过测量旋转是否可从编码器表示中恢复。具体而言,我们检查 SigLIP 和 ViT 特征分别来自 LLaVA OneVision 和 Qwen2.5-VL-7B-Instruct 模型,分别使用完整图像,以及检查 CLIP 表示在 LLaVA 1.5 和 LLaVA 1.6 中使用旋转前景块相对于自然背景图像的表示。我们的原假设是姿态信息未保留在编码器嵌入中,我们通过训练线性回归器从编码特征预测物体姿态来进行测试。与假设相反,我们发现姿态信息可从编码器表示中恢复:简单的线性模型能准确地从嵌入中预测物体姿态。这与 MLLMs 因视觉编码器局限性而难以处理 2D 姿态任务的假设相矛盾。虽然我们驳回了 MLLMs 因视觉编码器限制而难以处理 2D 姿态任务的被接受假设,但我们仍不清楚它们为何会失败。尽管完整解释超出本文范围,但我们表明尽管姿态信息存在,但其在数万特征中的扩散分布。这可能是 MLLMs 未能利用可用姿态信息的原因。

关键词

引用

@article{arxiv.2604.13321,
  title  = {Why MLLMs Struggle to Determine Object Orientations},
  author = {Anju Gopinath and Nikhil Krishnaswamy and Bruce Draper},
  journal= {arXiv preprint arXiv:2604.13321},
  year   = {2026}
}