中文

LoopSR:基于循环仿真-真实的足部机器人终身策略适应

机器人学 2025-11-20 v3 机器学习

摘要

强化学习(RL)通过仿真到真实的迁移展示出在足部 locomotion 中显著且可泛化的能力。然而,尽管像域随机化这样的自适应方法被期望能够提高策略在多样化环境下的鲁棒性,但它们可能会以牺牲特定环境中策略性能为代价,导致实际部署时表现次优,这是基于“没有免费定律”的结果。为此,我们提出LoopSR,一个在部署后持续细化 RL 策略的终身策略适应框架。LoopSR 使用基于Transformer的编码器将真实世界轨迹映射到潜在空间,并为进一步改进构建真实世界的数字孪生体。采用自编码器架构和对比学习方法来增强真实世界动态的特征提取。通过将解码器预测值与从预收集的仿真轨迹数据集中检索到的参数相结合,推导仿真参数用于持续训练。通过利用仿真持续训练,LoopSR 在 sim-to-sim 和 sim-to-real 实验中实现了优于强基准的更高数据效率,数据有限时表现卓越。请参阅 https://peilinwu.site/looping-sim-and-real.github.io/ 获取视频和代码。

关键词

引用

@article{arxiv.2409.17992,
  title  = {LoopSR: Looping Sim-and-Real for Lifelong Policy Adaptation of Legged Robots},
  author = {Peilin Wu and Weiji Xie and Jiahang Cao and Hang Lai and Weinan Zhang},
  journal= {arXiv preprint arXiv:2409.17992},
  year   = {2025}
}

备注

IROS 2025