几何值迭代:面向强化学习的动态误差感知KL正则化
机器学习
2021-10-06 v2
摘要
近期关于熵正则化强化学习(RL)方法的文献激增,表明在温和假设下Kullback-Leibler(KL)正则化可通过抵消误差为RL算法带来优势。然而,现有分析聚焦于具有恒定加权系数的固定正则化,未考虑系数被允许动态变化的情况。本文研究动态系数方案并给出首个渐近误差界。基于动态系数误差界,我们提出一种有效方案,根据误差大小调节系数,以利于更鲁棒的学习。作为补充,我们提出一种新颖算法——几何值迭代(GVI),其特点为动态误差感知KL系数设计,旨在减轻误差对性能的影响。实验表明,GVI能有效利用恒定KL系数均匀平均所带来的学习速度与鲁棒性之间的权衡。GVI与深度网络结合即使在无目标网络时也表现出稳定学习行为,而具有恒定KL系数的算法会剧烈振荡甚至无法收敛。
引用
@article{arxiv.2107.07659,
title = {Geometric Value Iteration: Dynamic Error-Aware KL Regularization for Reinforcement Learning},
author = {Toshinori Kitamura and Lingwei Zhu and Takamitsu Matsubara},
journal= {arXiv preprint arXiv:2107.07659},
year = {2021}
}
备注
ACML 2021