中文

群等变深度强化学习

机器学习 2020-07-08 v1 人工智能 机器学习

摘要

在强化学习(RL)中,卷积神经网络(CNNs)已作为函数逼近器成功应用于深度 Q 学习算法,以在各种环境中学习动作值函数与策略。然而,迄今为止,关于输入环境状态的对称变换等变表示的学习工作甚少。本文中,我们提出使用等变 CNN 来训练 RL 智能体,并研究其对变换等变 Q 值逼近的归纳偏置。我们证明,在高度对称的环境中,等变架构能显著提升 RL 智能体的性能与样本效率,同时所需参数更少。此外,我们表明它们对由仿射变换引起的环境变化具有鲁棒性。

关键词

引用

@article{arxiv.2007.03437,
  title  = {Group Equivariant Deep Reinforcement Learning},
  author = {Arnab Kumar Mondal and Pratheeksha Nair and Kaleem Siddiqi},
  journal= {arXiv preprint arXiv:2007.03437},
  year   = {2020}
}

备注

Presented at the ICML 2020 Workshop on Inductive Biases, Invariances and Generalization in RL