中文

基于 Fenchel-Rockafellar 对偶的强化学习

机器学习 2020-01-13 v2 机器学习

摘要

我们回顾凸对偶的基本概念,重点关注极为通用且极其有用的 Fenchel-Rockafellar 对偶。我们总结了该对偶如何应用于多种强化学习(RL)设定,包括策略评估或优化、在线或离线学习,以及折扣或无折扣回报。这些推导得出若干引人关注的结果,包括利用与行为无关(behavior-agnostic)的离线数据进行策略评估和在线策略梯度,以及通过最大似然优化学习策略的方法。尽管其中许多结果此前已以各种形式出现,我们提供了对这些结果的统一处理与视角,希望借此使研究者更好地运用并应用凸对偶工具,以在强化学习中取得进一步进展。

关键词

引用

@article{arxiv.2001.01866,
  title  = {Reinforcement Learning via Fenchel-Rockafellar Duality},
  author = {Ofir Nachum and Bo Dai},
  journal= {arXiv preprint arXiv:2001.01866},
  year   = {2020}
}