基于 Fenchel-Rockafellar 对偶的强化学习
机器学习
2020-01-13 v2 机器学习
摘要
我们回顾凸对偶的基本概念,重点关注极为通用且极其有用的 Fenchel-Rockafellar 对偶。我们总结了该对偶如何应用于多种强化学习(RL)设定,包括策略评估或优化、在线或离线学习,以及折扣或无折扣回报。这些推导得出若干引人关注的结果,包括利用与行为无关(behavior-agnostic)的离线数据进行策略评估和在线策略梯度,以及通过最大似然优化学习策略的方法。尽管其中许多结果此前已以各种形式出现,我们提供了对这些结果的统一处理与视角,希望借此使研究者更好地运用并应用凸对偶工具,以在强化学习中取得进一步进展。
引用
@article{arxiv.2001.01866,
title = {Reinforcement Learning via Fenchel-Rockafellar Duality},
author = {Ofir Nachum and Bo Dai},
journal= {arXiv preprint arXiv:2001.01866},
year = {2020}
}