基于选择性噪声注入与信息瓶颈的强化学习泛化
机器学习
2019-10-30 v1 人工智能
机器学习
摘要
策略泛化到新环境的能力是 RL 智能体广泛应用的关键。一种有前景的防止智能体策略过拟合于有限训练环境集合的方法,是应用最初为监督学习开发的正则化技术。然而,监督学习与 RL 之间存在显著差异。我们讨论了这些差异,并对现有正则化技术提出改进以更好地使其适应 RL。具体而言,我们关注依赖于向所学函数注入噪声的正则化技术,该类技术包含一些最广泛使用的方案如 Dropout 和 Batch Normalization。为使其适应 RL,我们提出选择性噪声注入(SNI),其保持注入噪声所具有的正则化效应,同时减轻其对梯度质量的不利影响。此外,我们证明信息瓶颈(IB)是一种特别适合 RL 的正则化技术,因其在训练 RL 智能体早期遇到的低数据 regime 中有效。将 IB 与 SNI 结合,我们显著优于当前最先进结果,包括在最近提出的泛化基准 Coinrun 上。
引用
@article{arxiv.1910.12911,
title = {Generalization in Reinforcement Learning with Selective Noise Injection and Information Bottleneck},
author = {Maximilian Igl and Kamil Ciosek and Yingzhen Li and Sebastian Tschiatschek and Cheng Zhang and Sam Devlin and Katja Hofmann},
journal= {arXiv preprint arXiv:1910.12911},
year = {2019}
}
备注
Published at Neurips 2019