群等变深度强化学习
机器学习
2020-07-08 v1 人工智能
机器学习
摘要
在强化学习(RL)中,卷积神经网络(CNNs)已作为函数逼近器成功应用于深度 Q 学习算法,以在各种环境中学习动作值函数与策略。然而,迄今为止,关于输入环境状态的对称变换等变表示的学习工作甚少。本文中,我们提出使用等变 CNN 来训练 RL 智能体,并研究其对变换等变 Q 值逼近的归纳偏置。我们证明,在高度对称的环境中,等变架构能显著提升 RL 智能体的性能与样本效率,同时所需参数更少。此外,我们表明它们对由仿射变换引起的环境变化具有鲁棒性。
引用
@article{arxiv.2007.03437,
title = {Group Equivariant Deep Reinforcement Learning},
author = {Arnab Kumar Mondal and Pratheeksha Nair and Kaleem Siddiqi},
journal= {arXiv preprint arXiv:2007.03437},
year = {2020}
}
备注
Presented at the ICML 2020 Workshop on Inductive Biases, Invariances and Generalization in RL