通过解耦式优先级经验回放增强连续控制任务上的深度确定性策略梯度
机器学习
2025-12-08 v1
摘要
背景:深度确定性策略梯度(DDPG)基于 Actor-Critic 架构,其中两个网络通常使用相同的回放转换 batch 训练。然而,Actor 和 Critic 的学习目标和更新动力学不同,这引发了是否应该使用均匀转换使用的最优性疑虑。目标:我们旨在通过为 Actor 和 Critic 使用解耦的转换 batch 来提高深度确定性策略梯度算法的性能。我们的目标是设计一种经验回放机制,为每个组件提供适当的学习信号。方法:我们引入了解耦式优先级经验回放(DPER),这是一种允许独立抽取用于 Actor 和 Critic 的转换 batch 的新方法。DPER 可以集成到任何在连续控制领域中运行的离策略深度强化学习算法中。我们将 DPER 与最新进的 Twin Delayed DDPG 算法结合,并在标准连续控制基准测试中评估其性能。结果:在 OpenAI Gym 套件中多个 MuJoCo 任务上,DPER 在常规经验回放和优先级经验回放等常规经验回放策略方面表现更好。结论:我们的发现表明,为 Actor 和 Critic 网络解耦经验回放可以增强训练动力学和最终策略质量。DPER 提供了一种可通用的机制,可提升广泛类的 actor-critic 离策略强化学习算法的性能。
引用
@article{arxiv.2512.05320,
title = {Enhancing Deep Deterministic Policy Gradients on Continuous Control Tasks with Decoupled Prioritized Experience Replay},
author = {Mehmet Efe Lorasdagi and Dogan Can Cicek and Furkan Burak Mutlu and Suleyman Serdar Kozat},
journal= {arXiv preprint arXiv:2512.05320},
year = {2025}
}