中文

用于强化学习泛化的局部特征交换

人工智能 2022-04-14 v1

摘要

在过去几年中,计算资源的加速和深度学习的研究使得一系列任务取得了显著的实际成功,特别是在计算机视觉领域。基于这些进展,强化学习也随着能够直接从视觉观测进行决策的智能体的出现而实现了飞跃。尽管取得了这些成功,神经架构的过度参数化导致对训练所用数据的记忆,从而缺乏泛化能力。基于视觉输入的强化学习智能体也遭受此现象,错误地将奖励与无关视觉特征(如背景元素)相关联。为缓解该问题,我们引入了一种新的正则化技术,即对特征图进行通道一致的局部置换(CLOP)。所提出的置换增强了对空间相关性的鲁棒性,并有助于防止 RL 中的过拟合行为。我们在 OpenAI Procgen Benchmark 上证明,使用 CLOP 方法训练的 RL 智能体表现出对视觉变化的鲁棒性,并且比使用其他最先进正则化技术训练的智能体具有更好的泛化特性。我们还证明了 CLOP 作为监督学习中一种通用正则化技术的有效性。

关键词

引用

@article{arxiv.2204.06355,
  title  = {Local Feature Swapping for Generalization in Reinforcement Learning},
  author = {David Bertoin and Emmanuel Rachelson},
  journal= {arXiv preprint arXiv:2204.06355},
  year   = {2022}
}