$f$-散度强化学习框架
机器学习
2021-12-15 v2 人工智能
摘要
深度强化学习(DRL)框架为序列决策提供了强大且广泛适用的数学形式化。本文提出一种新颖的 DRL 框架,称为 \emph{-散度强化学习(FRL)}。在 FRL 中,策略评估与策略改进阶段通过最小化学习策略与采样策略之间的 -散度同时执行,这与旨在最大化期望累积奖励的传统 DRL 算法不同。我们从理论上证明,最小化此类 -散度可使学习策略收敛至最优策略。此外,我们通过 Fenchel 共轭将 FRL 框架中训练智能体的过程转化为具有特定 函数的鞍点优化问题,从而形成策略评估与策略改进的新方法。通过数学证明与经验评估,我们展示了 FRL 框架具有两个优势:(1)策略评估与策略改进过程同时执行;(2)价值函数高估问题自然得到缓解。为评估 FRL 框架的有效性,我们在 Atari 2600 视频游戏上开展实验,表明在 FRL 框架中训练的智能体匹配或超越了基线 DRL 算法。
引用
@article{arxiv.2109.11867,
title = {The $f$-Divergence Reinforcement Learning Framework},
author = {Chen Gong and Qiang He and Yunpeng Bai and Zhou Yang and Xiaoyu Chen and Xinwen Hou and Xianjie Zhang and Yu Liu and Guoliang Fan},
journal= {arXiv preprint arXiv:2109.11867},
year = {2021}
}
备注
17 pages, 4 figures