基于帧实例化的异心感知器:通过帧实例化 disentangle 异心推理于体感先验
计算机视觉与模式识别
2026-02-06 v1 人工智能
摘要
随着对空间导向任务(如视觉语言导航/动作)的需求增长,视觉语言模型(VLM)中的异心感知能力正受到关注。然而,VLM在需要显式视角转换的异心空间查询方面仍脆弱,答案取决于目标中心坐标系中的推理,而非观察的相机视图。因此,我们引入异心感知器(Allocentric Perceiver),这是一种无需训练的策略,通过离线几何专家从一或多张图像中恢复度量3D状态,然后实例化与指令语义意图对齐的查询条件异心参考坐标系。通过确定性地将重建几何变换到目标坐标系并以结构化、几何 grounding 表示提示主干VLM,异心感知器将隐式推理中的心理旋转卸载到显式计算中。我们在多个主干家族上评估异心感知器,在空间推理基准测试中观察到在异心任务上一致且显著的收益(约10%),同时保持强大的体感性能,超越了空间感知微调模型和最先进的开源及专有模型。
引用
@article{arxiv.2602.05789,
title = {Allocentric Perceiver: Disentangling Allocentric Reasoning from Egocentric Visual Priors via Frame Instantiation},
author = {Hengyi Wang and Ruiqiang Zhang and Chang Liu and Guanjie Wang and Zehua Ma and Han Fang and Weiming Zhang},
journal= {arXiv preprint arXiv:2602.05789},
year = {2026}
}