中文

在可微多物理仿真中稳定强化学习

机器学习 2025-03-03 v2 人工智能 计算机视觉与模式识别 机器人学

摘要

基于 GPU 的并行仿真的最新进展使从业者能够在商用 GPU 上收集大量数据,并使用深度强化学习(RL)训练复杂的控制策略。然而,机器人学中 RL 的此类成功仅限于由快速刚体动力学充分仿真的任务。软体的仿真速度相比之下慢了几个数量级,从而由于样本复杂度的要求限制了 RL 的使用。为了应对这一挑战,本文提出了一种新的 RL 算法和仿真平台,以在涉及刚体和可变形物体的任务上实现 RL 的扩展。我们引入了 Soft Analytic Policy Optimization (SAPO),这是一种最大熵的一阶基于模型的 actor-critic RL 算法,它使用来自可微仿真的一阶解析梯度来训练随机 actor,以最大化预期回报和熵。伴随我们的方法,我们开发了 Rewarped,这是一个支持仿真刚体以外各种材料的并行可微多物理仿真平台。我们在 Rewarped 中重新实现了具有挑战性的操作和移动任务,并表明 SAPO 在一系列涉及刚体、铰接体和可变形物体交互的任务上优于基线方法。更多详情请见 https://rewarped.github.io/。

关键词

引用

@article{arxiv.2412.12089,
  title  = {Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation},
  author = {Eliot Xing and Vernon Luk and Jean Oh},
  journal= {arXiv preprint arXiv:2412.12089},
  year   = {2025}
}

备注

34 pages, 13 figures, 18 tables. Accepted to ICLR 2025 (Spotlight)