中文

自适应时域演员-评判网络:用于接触丰富可微分仿真中的策略学习

机器学习 2024-06-05 v2 人工智能

摘要

模型无关强化学习(Model-Free Reinforcement Learning, MFRL)利用策略梯度定理,在连续控制任务中取得了显著的成功。然而,这些方法因零阶梯度估计导致高梯度方差,进而产生次优策略。相反,采用可微分仿真的先阶模型基强化学习(First-Order Model-Based Reinforcement Learning, FO-MBRL)方法可获得降低方差的梯度,但在包含刚性动力学(如物理接触)的场景中易受采样误差的影响。本文探讨了该误差的来源,提出了自适应时域演员-评判网络(Adaptive Horizon Actor-Critic, AHAC),这是一种通过自适应模型基时域以避免刚性动力学从而降低梯度误差的FO-MBRL算法。实验结果表明,AHAC在一组 locomotion 任务中超越了 MFRL baseline,实现了 40% 以上的奖励提升,并能有效扩展到高维控制环境,同时改进了 wall-clock-time 效率。

关键词

引用

@article{arxiv.2405.17784,
  title  = {Adaptive Horizon Actor-Critic for Policy Learning in Contact-Rich Differentiable Simulation},
  author = {Ignat Georgiev and Krishnan Srinivasan and Jie Xu and Eric Heiden and Animesh Garg},
  journal= {arXiv preprint arXiv:2405.17784},
  year   = {2024}
}

备注

Website https://adaptive-horizon-actor-critic.github.io/