中文

SLAC:面向全身真实世界强化学习的仿真预训练潜行动作空间

机器人学 2025-08-19 v4 人工智能 机器学习

摘要

构建具备能力的家用和工业机器人需要掌握对多功能、高自由度(DoF)系统(如移动操作臂)的控制。虽然强化学习(RL)有希望自主获取机器人控制策略,但将其扩展到高自由度系统仍具有挑战性。在真实世界中进行直接 RL 需要安全的探索和高样本效率,这在实践中难以实现。另一方面,sim-to-real RL 通常因现实差距而脆弱。本文提出了 SLAC,一种通过利用低保真模拟器预训练任务无关的潜行动作空间,使复杂系统的真实世界 RL 变得可行的方法。SLAC 通过定制的无监督技能发现方法训练该潜行动作空间,旨在促进时间抽象、解耦和安全性,从而促进高效的下游学习。一旦潜行动作空间学习完成,SLAC 将其用作一种新型离线 RL 算法的动作接口,通过真实世界交互自主学习下游任务。我们在一系列双手移动操作任务上评估了 SLAC 与现有方法的对比,取得了最先进的性能。值得注意的是,SLAC 在不到一小时的真实世界交互中学习了接触丰富的全身任务,不依赖任何演示或手工设计的行为先验。更多信息及机器人视频见 robo-rl.github.io。

关键词

引用

@article{arxiv.2506.04147,
  title  = {SLAC: Simulation-Pretrained Latent Action Space for Whole-Body Real-World RL},
  author = {Jiaheng Hu and Peter Stone and Roberto Martín-Martín},
  journal= {arXiv preprint arXiv:2506.04147},
  year   = {2025}
}

备注

CoRL 2025