中文

深度约束Q学习

机器学习 2020-09-15 v2 机器人学 机器学习

摘要

在许多现实应用中,强化学习智能体必须在遵循特定规则或满足一系列约束的同时优化多个目标。基于奖励塑形(即在奖励信号中对不同目标进行加权组合)或拉格朗日方法(在损失函数中包含约束)的经典方法,无法保证智能体在所有时刻满足约束,并可能导致不期望的行为。当从动作值函数中提取离散策略时,可通过在最大化时限制动作空间来确保安全动作,但这会导致可行替代方案中的次优解。在本文中,我们提出约束Q学习(Constrained Q-learning),一种新颖的离策略强化学习框架,直接在Q更新中限制动作空间,以学习诱导约束MDP的最优Q函数及相应的安全策略。除仅涉及下一步动作的单步约束外,我们基于截断值函数引入了在当前目标策略下近似多步约束的表述。我们分析了约束Q学习在表格情形下的优势,并在自动驾驶高层决策应用中将约束DQN与奖励塑形及拉格朗日方法进行比较,考虑了安全性、靠右行驶和舒适性约束。我们在开源模拟器SUMO和真实HighD数据集上训练智能体。

关键词

引用

@article{arxiv.2003.09398,
  title  = {Deep Constrained Q-learning},
  author = {Gabriel Kalweit and Maria Huegle and Moritz Werling and Joschka Boedecker},
  journal= {arXiv preprint arXiv:2003.09398},
  year   = {2020}
}