中文

熵控制内在动机强化学习用于复杂地形四足机器人运动

机器人学 2025-12-16 v2

摘要

学习是生物系统和人工系统在模仿智能行为时的基础。从经典的 PPO(近端策略优化)开始,一系列深度强化学习算法因其稳定性和样本效率而被广泛用于训练四足机器人的运动策略。然而,在所有这些变体中,实验和仿真常常过早收敛,导致运动表现不佳和任务性能下降。因此,本文提出熵控制内在动机(ECIM),一种基于熵的强化学习算法,与 PPO 系列形成对比,通过将内在动机与自适应探索相结合来减少过早收敛。在实验中,为了与其他基线保持一致,我们将其应用于 Isaac Gym,涵盖六种地形类别:上坡、下坡、不平整粗糙地形、上楼梯、下楼梯和平坦地面。在对比中,我们的实验持续取得了更好的性能:任务奖励提升 4–12%,峰值身体俯仰振荡降低 23–29%,关节加速度减少 20–32%,关节力矩消耗下降 11–20%。总体而言,我们的模型 ECIM 通过结合熵控制和内在动机控制,在不同地形上的四足运动稳定性方面取得了更好的结果,同时降低了能量消耗,使其成为复杂机器人控制任务的实用选择。

关键词

引用

@article{arxiv.2512.06486,
  title  = {Entropy-Controlled Intrinsic Motivation Reinforcement Learning for Quadruped Robot Locomotion in Complex Terrains},
  author = {Wanru Gong and Xinyi Zheng and Yuan Hui and Zhongjun Li and Weiqiang Wang and Xiaoqing Zhu},
  journal= {arXiv preprint arXiv:2512.06486},
  year   = {2025}
}