中文

价值改进的Actor-Critic算法

机器学习 2026-01-19 v4 人工智能

摘要

为了学习决策问题的最优近似行动策略,现代Actor-Critic算法依赖深度神经网络(DNN)来参数化行动策略,并使用贪心化算子来迭代改进它。对DNN的依赖意味着一种基于梯度的改进,这种改进每一步的贪心程度远低于更贪心的算子(如Q学习算法使用的贪心更新)所能实现的改进。另一方面,策略的缓慢变化也可能有利于学习过程的稳定性,从而在贪心化和稳定性之间产生权衡。为了更好地解决这一权衡,我们提出将行动策略与评论家评估的策略解耦。这使得智能体能够分别用更贪心的更新来改进评论家的策略(例如价值改进),同时保持对参数化行动策略的缓慢梯度改进。我们使用有限时域中广义策略迭代的流行分析方案研究了该方法的收敛性。实验上,将价值改进纳入流行的离策略Actor-Critic算法TD3和SAC中,在DeepMind连续控制领域的不同环境中,显著提高或匹配了各自基线的性能,且计算和实现成本可忽略不计。

关键词

引用

@article{arxiv.2406.01423,
  title  = {Value Improved Actor Critic Algorithms},
  author = {Yaniv Oren and Moritz A. Zanger and Pascal R. van der Vaart and Mustafa Mert Celikok and Matthijs T. J. Spaan and Wendelin Bohmer},
  journal= {arXiv preprint arXiv:2406.01423},
  year   = {2026}
}