通过约束强化学习直接指定行为
机器学习
2022-06-22 v6
摘要
强化学习的标准表述缺乏一种实用的方法来指定哪些行为是可容许的、哪些是被禁止的。从业者最常通过手动设计奖励函数来完成行为指定任务,这是一个反直觉的过程,需要多次迭代且容易导致智能体进行奖励黑客(reward hacking)。在本工作中,我们认为几乎仅被用于安全强化学习(safe RL)的约束强化学习(constrained RL)也有潜力显著减少应用强化学习项目中用于奖励指定所花费的工作量。为此,我们提出在 CMDP 框架中指定行为偏好,并使用拉格朗日方法自动权衡这些行为约束。具体而言,我们研究如何调整 CMDP 以在同时遵守多个约束的情况下解决基于目标(goal-based)的任务。我们在一组与视频游戏中 NPC 设计的强化学习应用相关的连续控制任务上评估了该框架。
引用
@article{arxiv.2112.12228,
title = {Direct Behavior Specification via Constrained Reinforcement Learning},
author = {Julien Roy and Roger Girgis and Joshua Romoff and Pierre-Luc Bacon and Christopher Pal},
journal= {arXiv preprint arXiv:2112.12228},
year = {2022}
}