中文

Adviser-Actor-Critic:消除强化学习控制中的稳态误差

机器学习 2025-02-05 v1 人工智能

摘要

高精度控制任务对强化学习(RL)算法提出了巨大挑战,常常由于网络近似的不准确和样本质量不佳而导致次优性能。当任务要求智能体达到精确的目标状态时,这些问题会加剧,这在机器人技术和其他现实应用中很常见。我们引入了 Adviser-Actor-Critic(AAC),旨在通过将反馈控制理论的精度与 RL 的自适应学习能力相结合来解决精度控制困境,其特点是包含一个指导 actor 优化控制动作的 Adviser,从而提高目标达成的精度。最后,通过基准测试,AAC 在精度至关重要且目标条件化的任务中优于标准 RL 算法,证明了 AAC 的高精度、可靠性和鲁棒性。代码可在:https://anonymous.4open.science/r/Adviser-Actor-Critic-8AC5 获取。

关键词

引用

@article{arxiv.2502.02265,
  title  = {Adviser-Actor-Critic: Eliminating Steady-State Error in Reinforcement Learning Control},
  author = {Donghe Chen and Yubin Peng and Tengjie Zheng and Han Wang and Chaoran Qu and Lin Cheng},
  journal= {arXiv preprint arXiv:2502.02265},
  year   = {2025}
}

备注

13 pages, 9 figures