释放Soft Actor-Critic在模仿学习中的潜力
机器人学
2025-09-30 v1
摘要
基于学习的方法使机器人能够获得具有更高自然度和适应性的仿生运动。其中,模仿学习(IL)已被证明能有效地将复杂的运动模式从动物转移到机器人系统。然而,当前最先进的框架主要依赖于近端策略优化(PPO),这是一种在策略算法,优先考虑稳定性而非样本效率和策略泛化。本文提出了一种新颖的IL框架,将对抗性运动先验(AMP)与离策略的Soft Actor-Critic(SAC)算法相结合,以克服这些局限性。这种整合利用了基于经验回放的学习和熵正则化探索,实现了自然行为和执行任务,提高了数据效率和鲁棒性。我们在涉及多个参考运动和不同地形的四足步态上评估了所提出的方法(AMP+SAC)。实验结果表明,所提出的框架不仅保持了稳定的任务执行,而且与广泛使用的AMP+PPO方法相比,获得了更高的模仿奖励。这些发现突显了离策略IL公式在推进机器人运动生成方面的潜力。
引用
@article{arxiv.2509.24539,
title = {Unlocking the Potential of Soft Actor-Critic for Imitation Learning},
author = {Nayari Marie Lessa and Melya Boukheddimi and Frank Kirchner},
journal= {arXiv preprint arXiv:2509.24539},
year = {2025}
}