基于 Wasserstein 自适应价值估计的 Actor-Critic 强化学习
机器学习
2025-03-10 v2 系统与控制
系统与控制
机器学习
摘要
我们提出 Wasserstein Adaptive Value Estimation for Actor-Critic (WAVE),一种通过自适应 Wasserstein 正则化来增强深度强化学习稳定性的方法。我们的方法通过在 critic 的损失函数中纳入自适应加权 Wasserstein 正则化项,解决了 actor-critic 算法固有的不稳定性问题。我们证明了 WAVE 在 critic 的均方误差上实现 收敛率,并通过 Wasserstein 基于正则化提供了稳定性理论保证。通过使用 Sinkhorn 近似实现计算效率,我们的方法会根据 agent 的性能自动调整正则化。理论分析和实验结果表明,WAVE 的性能优于标准的 actor-critic 方法。
引用
@article{arxiv.2501.10605,
title = {Wasserstein Adaptive Value Estimation for Actor-Critic Reinforcement Learning},
author = {Ali Baheri and Zahra Shahrooei and Chirayu Salgarkar},
journal= {arXiv preprint arXiv:2501.10605},
year = {2025}
}