变分 Actor-Critic 算法
机器学习
2023-01-18 v4 最优化与控制
摘要
我们引入一类基于对价值函数和策略进行变分表述的变分 Actor-Critic 算法。该变分表述的目标函数由两部分组成:一部分用于最大化价值函数,另一部分用于最小化贝尔曼残差。除了同时对价值函数和策略进行更新的普通梯度下降外,我们还提出了两种变体,即裁剪法和翻转法,以加速收敛。我们还证明,当贝尔曼残差的预因子足够大时,该算法的不动点接近最优策略。
引用
@article{arxiv.2108.01215,
title = {Variational Actor-Critic Algorithms},
author = {Yuhua Zhu and Lexing Ying},
journal= {arXiv preprint arXiv:2108.01215},
year = {2023}
}