中文

PEAfowl:用于双手操作的感知增强多视角视觉-语言-动作模型

计算机视觉与模式识别 2026-01-27 v1 人工智能 机器人学

摘要

杂乱场景中的双手操作要求策略在遮挡、视角和场景变化下保持稳定。现有的视觉-语言-动作(VLA)模型往往无法泛化,因为(i)多视角特征通过视角无关的 token 拼接进行融合,导致 3D 一致的空间理解较弱,以及(ii)语言作为全局条件注入,导致指令定位粗糙。在本文中,我们提出了 PEAfowl,一种用于双手操作的感知增强多视角 VLA 策略。对于空间推理,PEAfowl 预测逐 token 的深度分布,执行可微 3D 提升,并聚合局部跨视角邻居以形成几何奠基的、跨视角一致的特征表示。对于指令定位,我们提出用基于 Perceiver 风格的、在冻结 CLIP 视觉特征上的文本感知读出机制来替代全局条件,从而实现迭代证据累积。为了在不增加推理开销的情况下克服有噪声且不完整的商品级深度,我们应用了仅用于训练的深度蒸馏,利用预训练的深度教师模型来监督深度分布头,为感知前端提供几何感知先验。在领域随机化设置的 RoboTwin 2.0 上,PEAfowl 在成功率上比最强基线提高了 23.0 个百分点,真实机器人实验进一步证明了可靠的 sim-to-real 迁移以及深度蒸馏带来的一致性提升。项目网站:https://peafowlvla.github.io/。

关键词

引用

@article{arxiv.2601.17885,
  title  = {PEAfowl: Perception-Enhanced Multi-View Vision-Language-Action for Bimanual Manipulation},
  author = {Qingyu Fan and Zhaoxiang Li and Yi Lu and Wang Chen and Qiu Shen and Xiao-xiao Long and Yinghao Cai and Tao Lu and Shuo Wang and Xun Cao},
  journal= {arXiv preprint arXiv:2601.17885},
  year   = {2026}
}