基于课程的强化学习用于复杂奖励函数
机器学习
2025-02-11 v2 机器人学
摘要
强化学习(RL)已成为解决控制问题的强大工具,但其实际应用常因复杂奖励函数带来的难题而受限。奖励假设认为,任何目标都可以封装在标量奖励函数中,但在不被利用的情况下平衡个体、potentially 对抗的奖励项仍具有挑战性。为克服传统 RL 方法对竞争性奖励项精确平衡的限制,我们提出了两种阶段的奖励课程,首先最大化简单奖励函数,然后过渡到完整的复杂奖励。我们提供的方法基于演员如何拟合评论家的程度,以自动确定两个阶段之间的转换点。此外,我们引入了灵活的回放缓冲区,通过重用一个阶段中的样本来实现高效的阶段转换。我们在 DeepMind 控制套件上进行评估,该套件被修改为在奖励定义中包含额外的约束项。我们进一步在移动机器人场景中进行评估,该场景包含更多竞争性奖励项。在两种情况下,我们的两种阶段奖励课程均实现了显著的性能提升,超越了在课程训练之外获得的基线。与其利用约束项中的奖励项相比,它能够学习平衡任务完成和约束满足的策略。我们的结果表明,两种阶段奖励课程在具有复杂奖励的环境中实现了高效和稳定的 RL,为在真实世界应用中构建更具鲁棒性和可适应性的机器人系统铺平了道路。
关键词
引用
@article{arxiv.2410.16790,
title = {Curriculum Reinforcement Learning for Complex Reward Functions},
author = {Kilian Freitag and Kristian Ceder and Rita Laezza and Knut Åkesson and Morteza Haghir Chehreghani},
journal= {arXiv preprint arXiv:2410.16790},
year = {2025}
}