KL 正则化 RL 中的信息不对称
机器学习
2019-05-06 v1 人工智能
机器学习
摘要
许多现实世界任务展现出丰富的结构,这些结构在状态空间的不同部分或时间上重复出现。在这项工作中,我们研究了利用这种重复结构来加速和正则化学习的可能性。我们从 KL 正则化的期望奖励目标出发,该目标引入了一个额外的组件,即默认策略。我们不是依赖固定的默认策略,而是从数据中学习它。但关键的是,我们限制了默认策略接收的信息量,迫使其学习有助于策略更快学习的可复用行为。我们将这一策略形式化,并讨论了其与信息瓶颈方法以及变分 EM 算法的联系。我们在离散和连续动作域中展示了实证结果,并证明对于某些任务,与策略一起学习默认策略可以显著加快并改善学习。
引用
@article{arxiv.1905.01240,
title = {Information asymmetry in KL-regularized RL},
author = {Alexandre Galashov and Siddhant M. Jayakumar and Leonard Hasenclever and Dhruva Tirumala and Jonathan Schwarz and Guillaume Desjardins and Wojciech M. Czarnecki and Yee Whye Teh and Razvan Pascanu and Nicolas Heess},
journal= {arXiv preprint arXiv:1905.01240},
year = {2019}
}
备注
Accepted as a conference paper at ICLR 2019