中文

基于 Wasserstein 自适应价值估计的 Actor-Critic 强化学习

机器学习 2025-03-10 v2 系统与控制 系统与控制 机器学习

摘要

我们提出 Wasserstein Adaptive Value Estimation for Actor-Critic (WAVE),一种通过自适应 Wasserstein 正则化来增强深度强化学习稳定性的方法。我们的方法通过在 critic 的损失函数中纳入自适应加权 Wasserstein 正则化项,解决了 actor-critic 算法固有的不稳定性问题。我们证明了 WAVE 在 critic 的均方误差上实现 O(1k)\mathcal{O}\left(\frac{1}{k}\right) 收敛率,并通过 Wasserstein 基于正则化提供了稳定性理论保证。通过使用 Sinkhorn 近似实现计算效率,我们的方法会根据 agent 的性能自动调整正则化。理论分析和实验结果表明,WAVE 的性能优于标准的 actor-critic 方法。

关键词

引用

@article{arxiv.2501.10605,
  title  = {Wasserstein Adaptive Value Estimation for Actor-Critic Reinforcement Learning},
  author = {Ali Baheri and Zahra Shahrooei and Chirayu Salgarkar},
  journal= {arXiv preprint arXiv:2501.10605},
  year   = {2025}
}