中文

基于前向 Kullback-Leibler 散度优化的乐观强化学习

机器学习 2022-04-25 v2

摘要

本文将对强化学习(RL)中传统优化方法的新诠释视为使用反向 Kullback-Leibler(KL)散度的优化问题,并推导出使用前向 KL 散度而非反向 KL 散度的新优化方法。尽管 RL 最初旨在通过策略优化间接最大化回报,Levine 近期的工作提出了一种将最优性作为随机变量显式考虑的不同推导过程。本文遵循该概念,将价值函数与策略的传统学习法则表述为含最优性的反向 KL 散度优化问题。着眼于 KL 散度的不对称性,推导出含前向 KL 散度的新优化问题。值得注意的是,此类新优化问题可视为乐观 RL。该乐观性由从不确定性参数转换出的超参数直观指定。此外,当其与优先经验回放和资格迹结合时,乐观性可增强,二者均加速学习。通过 Pybullet 数值模拟中的学习趋势考察了此种预期乐观性的效果。结果表明,适度乐观加速了学习并 yielding 更高回报。在真实机器人仿真中,所提带适度乐观的方法优于一种最先进 RL 方法。

关键词

引用

@article{arxiv.2105.12991,
  title  = {Optimistic Reinforcement Learning by Forward Kullback-Leibler Divergence Optimization},
  author = {Taisuke Kobayashi},
  journal= {arXiv preprint arXiv:2105.12991},
  year   = {2022}
}

备注

14 pages, 6 figures