中文

对不起戴夫,恐怕我做不到,从被禁动作中学习的深度 Q 学习

机器学习 2020-08-14 v4 机器学习

摘要

强化学习(RL)的使用仍局限于仿真或通过建议增强人操系统。现实世界环境(例如工业机器人和电网)通常基于安全约束而设计,这些约束以有效动作掩码或应急控制器的形式实现。例如,机器人的运动范围和电机角度可被限制于物理边界内。违反约束因而导致动作被拒绝或进入由外部控制器驱动的安全模式,使 RL 智能体无法从错误中学习。本文中,我们提出对最先进深度 RL 算法(DQN)的简单修改,使其能从被禁动作中学习。为此,标准 Q 学习更新被一个受结构化分类启发的额外安全损失所增强。我们凭经验表明,与使用标准 DQN 相比,它减少了学习阶段中违反约束的次数,并加速收敛至近最优策略。实验在视觉网格世界环境和文本世界域上进行。

关键词

引用

@article{arxiv.1910.02078,
  title  = {I'm sorry Dave, I'm afraid I can't do that, Deep Q-learning from forbidden action},
  author = {Mathieu Seurin and Philippe Preux and Olivier Pietquin},
  journal= {arXiv preprint arXiv:1910.02078},
  year   = {2020}
}

备注

Accepted at Internationnal Joint Conference on Neural Networks (IJCNN'2020)