中文

噪声条件化能量基退火奖励 (NEAR):面向观察行为的仿真学习生成框架

机器人学 2025-02-13 v2 人工智能

摘要

本文提出一种新型仿生学习框架,基于能量基生成模型,能够通过仅包含状态信息的专家运动轨迹学习复杂的物理相关机器人运动策略。我们的算法称为噪声条件化能量基退火奖励 (Noise-conditioned Energy-based Annealed Rewards, NEAR),通过对专家运动数据分布进行多次扰动,利用去噪得分匹配学习数据分布能量函数的平滑且明确的表征。我们将这些学习到的能量函数作为奖励函数,用于强化学习学习仿生策略。我们还提出一种策略,逐步切换所学习的能量函数,确保所学习奖励在策略生成样本的流形中始终具有明确性。我们在复杂的人形机器人任务上进行评估,包括 locomotion 和 martial arts,并与基于状态的对抗仿生学习算法如 Adversarial Motion Priors (AMP) 进行比较。我们的框架规避了对抗仿生学习技术的优化挑战,结果在多个仿生学习场景下的多个定性指标上与 AMP 相当。

关键词

引用

@article{arxiv.2501.14856,
  title  = {Noise-conditioned Energy-based Annealed Rewards (NEAR): A Generative Framework for Imitation Learning from Observation},
  author = {Anish Abhijit Diwan and Julen Urain and Jens Kober and Jan Peters},
  journal= {arXiv preprint arXiv:2501.14856},
  year   = {2025}
}

备注

Accepted as a conference paper at the International Conference on Learning Representations (ICLR) 2025. Revised to include review feedback