中文

视觉运动策略中是否需要本体感受状态?

机器人学 2025-09-25 v2 人工智能

摘要

基于模仿学习的视觉运动策略已广泛应用于机器人操作中,其中视觉观测和本体感受状态通常被共同采用以实现精确控制。然而,在本研究中,我们发现这种常见做法使策略过度依赖本体感受状态输入,导致对训练轨迹过拟合,并造成空间泛化能力差。相反,我们提出了无状态策略,移除本体感受状态输入,并仅以视觉观测为条件预测动作。无状态策略构建于相对末端执行器动作空间中,并应确保包含完整的任务相关视觉观测,此处由双广角腕部相机提供。实证结果表明,无状态策略实现了比基于状态的策略显著更强的空间泛化能力:在跨越多种机器人形态的真实世界任务中,如拾取与放置、具有挑战性的叠衬衫以及复杂的全身操作,高度泛化的平均成功率从0%提高到85%,水平泛化从6%提高到64%。此外,它们在数据效率和跨形态适应性方面也显示出优势,增强了其在真实世界部署中的实用性。访问以下网址了解更多:https://statefreepolicy.github.io。

关键词

引用

@article{arxiv.2509.18644,
  title  = {Do You Need Proprioceptive States in Visuomotor Policies?},
  author = {Juntu Zhao and Wenbo Lu and Di Zhang and Yufeng Liu and Yushen Liang and Tianluo Zhang and Yifeng Cao and Junyuan Xie and Yingdong Hu and Shengjie Wang and Junliang Guo and Dequan Wang and Yang Gao},
  journal= {arXiv preprint arXiv:2509.18644},
  year   = {2025}
}

备注

Project page: https://statefreepolicy.github.io