机器人操作中视觉-本体感知策略会何时失败?
机器人学
2026-02-13 v1
摘要
本体感知信息对于提供实时机器人状态以实现精确伺服控制至关重要。其与视觉的协作被期望能提高复杂任务中操作策略的性能。然而,近期研究报告了视觉-本体感知策略泛化性的不一致观察。本文通过进行受控实验来探讨此问题。我们发现,在机器人运动转换的子阶段(需要目标定位)时,视觉模态在视觉-本体感知策略中发挥的作用有限。进一步分析表明,策略会自然地倾向于选择提供更快损失缩减的简洁本体感知信号,从而在优化过程中占据主导地位,抑制了在运动转换阶段学习视觉模态的能力。为缓解此问题,我们提出了基于相位引导的梯度调整(GAP)算法,通过自适应调节本体感知的优化,实现视觉-本体感知策略中的动态协作。具体而言,我们利用本体感知捕获机器人状态并估计每个时间步在轨迹中属于运动转换阶段的概率。在策略学习期间,我们应用精细的调整,根据估计的概率降低本体感知梯度的幅度,从而实现鲁棒且可泛化的视觉-本体感知策略。综合实验表明,GAP 可在模拟环境和真实环境中适用,适用于单臂和双臂 setups,并兼容常规模型和 Vision-Language-Action 模型。我们认为本工作可为开发视觉-本体感知策略在机器人操作中的应用提供有价值的见解。
引用
@article{arxiv.2602.12032,
title = {When would Vision-Proprioception Policies Fail in Robotic Manipulation?},
author = {Jingxian Lu and Wenke Xia and Yuxuan Wu and Zhiwu Lu and Di Hu},
journal= {arXiv preprint arXiv:2602.12032},
year = {2026}
}
备注
Accepted by ICLR 2026