基于隐式 Q 值的隐式正则化强化学习
机器学习
2022-06-01 v2
摘要
函数是许多强化学习(Reinforcement Learning, RL)算法中的核心量,RL 智能体依据相对于 的(软)贪婪策略行动。它是一个强大的工具,允许在无环境模型甚至无显式策略建模的情况下进行动作选择。然而,该方案仅能用于离散动作任务且动作数较少,因为否则 softmax 无法精确计算。尤其是现代 actor-critic 架构中用于处理连续动作空间的函数近似,本质上阻止了 softmax 的精确计算。我们提议通过将 函数隐式参数化为对数策略与值函数之和来缓解此问题。我们利用所得参数化推导了一种实用的离策略深度 RL 算法,适用于大动作空间,并强制策略与 值之间的 softmax 关系。我们提供了算法的理论分析:从近似动态规划视角,我们展示了其与正则化值迭代版本的等价性,该版本考虑了熵与 Kullback-Leibler 正则化,并具有良好的误差传播结果。随后我们在经典控制任务上评估了我们的算法,其结果可与最先进的方法竞争。
引用
@article{arxiv.2108.07041,
title = {Implicitly Regularized RL with Implicit Q-Values},
author = {Nino Vieillard and Marcin Andrychowicz and Anton Raichuk and Olivier Pietquin and Matthieu Geist},
journal= {arXiv preprint arXiv:2108.07041},
year = {2022}
}
备注
AISTATS 2022