中文

约束即奖励:无需奖励函数的机器人强化学习

机器人学 2025-01-10 v2 人工智能 机器学习

摘要

强化学习已成为生成复杂机器人行为的必备算法。然而,要学习此类行为,需设计描述任务的奖励函数,这通常包含多个需要平衡的目标。这种调谐过程称为奖励工程,通常涉及大量试错。在本文中,为避免此试错过程,我们提出了“约束即奖励” (CaR) 的概念。CaR 使用多个约束函数而非奖励函数来表述任务目标,并通过拉格朗日方法求解具有约束的强化学习问题。通过采用此方法,由于拉格朗日乘子充当目标之间的权重,因此自动实现不同目标的平衡。此外,我们将演示,作为不等式的约束提供了对为任务设计的优化目标的直观解释。我们将该方法应用于六轮伸缩腿机器人站立运动的生成任务,证明即使使用人为设计的奖励函数难以学习,所提方法也成功获得了目标行为。

关键词

引用

@article{arxiv.2501.04228,
  title  = {Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions},
  author = {Yu Ishihara and Noriaki Takasugi and Kotaro Kawakami and Masaya Kinoshita and Kazumi Aoyama},
  journal= {arXiv preprint arXiv:2501.04228},
  year   = {2025}
}