视觉语言模型中的第三人称偏见
计算机视觉与模式识别
2026-02-19 v1 人工智能
摘要
视觉视角迁移——从另一观察者的视角推断世界外观——是社会认知的基础。我们引入 FlipSet,一个用于视觉语言模型第二层视觉视角迁移(L2 VPT)的诊断基准测试。该任务要求模拟 2D 角色字符串从另一代理人视角的 180 度旋转,隔离空间变换而非 3D 场景复杂性。评估 103 个 VLMs,发现存在系统性的第三人称偏见:绝大多数低于随机水平,约有四分之三的错误再现摄像机视角。控制实验揭示了构成性缺陷——模型在理论心智准确率高且在孤立情况下心理旋转优于随机,但在需要整合时失败。这一解离表明当前 VLMs lacks 绑定社会意识到空间操作的机制,表明基于模型的空间推理存在根本性限制。FlipSet 为诊断多模态系统的视角迁移能力提供了基于认知的测试平台。
引用
@article{arxiv.2602.15892,
title = {Egocentric Bias in Vision-Language Models},
author = {Maijunxian Wang and Yijiang Li and Bingyang Wang and Tianwei Zhao and Ran Ji and Qingying Gao and Emmy Liu and Hokin Deng and Dezhi Luo},
journal= {arXiv preprint arXiv:2602.15892},
year = {2026}
}