中文

利用可操控动作值近似误差改进演员-评论家训练

机器学习 2025-08-21 v2 机器学习

摘要

离策略演员-评论家算法在深度强化学习的连续控制任务中展现出强大潜力。其成功主要源于利用悲观的状态-动作值函数更新,这减少了函数近似误差并稳定了学习过程。然而,过度的悲观会限制探索,阻碍智能体有效改进其策略。相反,乐观可以鼓励探索,但如果管理不当,可能导致高风险行为和不稳定的学习。为了解决这一权衡问题,我们提出了效用软演员-评论家(USAC),这是一个新颖的框架,允许对演员和评论家的悲观与乐观进行独立、可解释的控制。USAC 利用效用函数,根据评论家的不确定性动态调整其探索策略,从而在乐观与悲观之间实现任务特定的平衡。这种方法超越了悲观或乐观的二元选择,使得该方法在理论上具有意义,在实践中也切实可行。在多种连续控制任务上的实验表明,调整悲观或乐观的程度会显著影响性能。当配置适当时,USAC 始终优于最先进的算法,证明了其实用性和可行性。

关键词

引用

@article{arxiv.2406.03890,
  title  = {Improving Actor-Critic Training with Steerable Action-Value Approximation Errors},
  author = {Bahareh Tasdighi and Nicklas Werge and Yi-Shan Wu and Melih Kandemir},
  journal= {arXiv preprint arXiv:2406.03890},
  year   = {2025}
}