中文

仿认知的token克服多模态模型中的客观中心偏差

计算机视觉与模式识别 2026-01-26 v1 人工智能 神经元与认知

摘要

多模态语言模型(MLMs)在语义视觉语言任务中表现良好,但在需要采用其他agent视角进行空间推理的任务中表现不佳。这些错误反映出持久的客体中心偏差,引发关于当前模型是否支持客体中心推理的疑问。受人类空间认知启发,我们提出perspective tokens,这些专用embedding通过(1)通过身体关键点线索或(2)支持心理旋转的抽象表示来编码方向。将这些tokens集成到LLaVA-1.5-13B中,可在level-2视觉视角任务上取得好表现。在合成和自然场景基准(Isle Bricks V2、COCO、3DSRBench)上,perspective tokens提升了准确率,旋转基方法在非人类reference agent上具有良好泛化。表征性分析揭示,微调增强了基础模型中已存在的latent方向敏感性,表明MLMs包含客体中心推理的前体但缺乏适当的内部结构。总体而言,直接将仿认知的空间结构嵌入token空间,提供了一种轻量级、模型无关的视角捕获机制,实现更符合人类水平的空间推理。

关键词

引用

@article{arxiv.2601.16378,
  title  = {Cognitively-Inspired Tokens Overcome Egocentric Bias in Multimodal Models},
  author = {Bridget Leonard and Scott O. Murray},
  journal= {arXiv preprint arXiv:2601.16378},
  year   = {2026}
}