UAOR:面向视觉语言动作模型的不确定性感知观测注入
计算机视觉与模式识别
2026-02-23 v1 机器人学
摘要
视觉语言动作(VLA)模型利用预训练的视觉语言模型(VLM)作为 backbone 将图像和指令映射到动作,展现出卓越的通用机器人操控潜力。为提升性能,现有方法常纳入额外观测线索(如深度图、点云)或辅助模块(如目标检测器、编码器),以实现更精确可靠的任务执行,但这些方法通常需要高成本的数据收集和额外训练。灵感来源于发现视觉语言模型中前馈网络(FFN)可充当“键-值记忆”,本文提出不确定性感知观测注入(UAOR),一种有效且无需训练、即插即用的VLA模型模块。具体而言,当当前语言模型层 exhibits 高不确定性时(由动作熵度量),UAOR通过注意力检索将关键观测信息注入到下一个层的前馈网络(FFN)中。这一机制帮助VLA模型在推理期间更好地关注观测,从而实现更自信、更忠实的动作生成。全面实验表明,我们的方法在仿真和真实世界任务中均能显著提升多样VLA模型的性能,同时几乎没有额外开销。值得注意的是,UAOR消除了对额外观测线索或模块的需求,使其成为现有VLA管道的通用且实用的插件。项目页面位于 https://uaor.jiabingyang.cn。
引用
@article{arxiv.2602.18020,
title = {UAOR: Uncertainty-aware Observation Reinjection for Vision-Language-Action Models},
author = {Jiabing Yang and Yixiang Chen and Yuan Xu and Peiyan Li and Xiangnan Wu and Zichen Wen and Bowen Fang and Tao Yu and Zhengbo Zhang and Yingda Li and Kai Wang and Jing Liu and Nianfeng Liu and Yan Huang and Liang Wang},
journal= {arXiv preprint arXiv:2602.18020},
year = {2026}
}