中文

带约束的深度逆 Q 学习

机器学习 2020-08-05 v1 机器人学 机器学习

摘要

流行的极大熵逆强化学习方法需要在奖励函数估计下计算最优策略的期望状态访问频率。这通常要求在算法内循环中作中间值估计,显著拖慢收敛。本工作中,我们引入一类新算法,只需求解一次演示行为背后的 MDP 即可恢复专家策略。这得益于一种在 Q 学习结构中利用演示概率行为假设的建模。我们提出逆动作值迭代,能够以解析闭式完全恢复外部智能体的底层奖励。我们进一步提供一组不依赖环境模型的基于采样的变体。我们展示如何通过函数逼近将此类算法推广至连续状态空间,并估计相应的动作值函数,从而得到尽可能接近外部智能体策略的策略,同时可选择性满足一组预定义的硬约束。我们在 Objectworld 基准上评估了称为逆动作值迭代、逆 Q 学习与深度逆 Q 学习的所得算法,显示出相较(深度)极大熵算法最高达数个数量级的加速。我们进一步在开源模拟器 SUMO 中将深度约束逆 Q 学习应用于学习自主变道任务,在对应于 30 分钟演示的数据上训练后实现了熟练驾驶。

关键词

引用

@article{arxiv.2008.01712,
  title  = {Deep Inverse Q-learning with Constraints},
  author = {Gabriel Kalweit and Maria Huegle and Moritz Werling and Joschka Boedecker},
  journal= {arXiv preprint arXiv:2008.01712},
  year   = {2020}
}