中文

几何值迭代:面向强化学习的动态误差感知KL正则化

机器学习 2021-10-06 v2

摘要

近期关于熵正则化强化学习(RL)方法的文献激增,表明在温和假设下Kullback-Leibler(KL)正则化可通过抵消误差为RL算法带来优势。然而,现有分析聚焦于具有恒定加权系数的固定正则化,未考虑系数被允许动态变化的情况。本文研究动态系数方案并给出首个渐近误差界。基于动态系数误差界,我们提出一种有效方案,根据误差大小调节系数,以利于更鲁棒的学习。作为补充,我们提出一种新颖算法——几何值迭代(GVI),其特点为动态误差感知KL系数设计,旨在减轻误差对性能的影响。实验表明,GVI能有效利用恒定KL系数均匀平均所带来的学习速度与鲁棒性之间的权衡。GVI与深度网络结合即使在无目标网络时也表现出稳定学习行为,而具有恒定KL系数的算法会剧烈振荡甚至无法收敛。

关键词

引用

@article{arxiv.2107.07659,
  title  = {Geometric Value Iteration: Dynamic Error-Aware KL Regularization for Reinforcement Learning},
  author = {Toshinori Kitamura and Lingwei Zhu and Takamitsu Matsubara},
  journal= {arXiv preprint arXiv:2107.07659},
  year   = {2021}
}

备注

ACML 2021