中文

函数评论家对Actor-Critic至关重要:从异策略稳定性到高效探索

机器学习 2026-02-10 v4 人工智能

摘要

Actor-Critic(AC)框架在异策略强化学习中取得了强大的经验成功,但存在“移动目标”问题,即被评估的策略不断变化。函数评论家,或称策略条件值函数,通过显式地将策略表示作为输入来解决此问题。虽然概念上很有吸引力,但先前的努力一直难以与标准AC保持竞争力。在这项工作中,我们重新审视了Actor-Critic框架中的函数评论家,并确定了使其成为必需品而非奢侈品的两个关键方面。首先,我们展示了它们在稳定“致命三要素”与“移动目标”之间复杂相互作用方面的能力。我们在线性函数逼近下提供了一个收敛的异策略AC算法,该算法消除了理论与实践之间若干长期存在的障碍:它利用基于目标的TD学习,适应动态行为策略,并在没有限制性“全覆盖”假设的情况下运行。通过形式化一个双重信任-覆盖机制,我们的框架为追求样本效率提供了原则性指导——严格管理行为策略更新和评论家重新评估,以最大化异策略数据的效用。其次,我们揭示了函数评论家与高效探索之间的基础性联系。我们证明,现有的后验采样无模型近似在捕捉策略依赖的不确定性方面存在局限,而函数评论家形式体系弥补了这一差距。据我们所知,这些结果代表了RL文献中同类首创的贡献。在实践中,我们提出了一种定制的神经网络架构和一个极简的AC算法。在DeepMind Control Suite的初步实验中,该实现在没有标准实现启发式方法的情况下,取得了与最先进方法竞争的性能。

关键词

引用

@article{arxiv.2509.22964,
  title  = {Functional Critics Are Essential for Actor-Critic: From Off-Policy Stability to Efficient Exploration},
  author = {Qinxun Bai and Yuxuan Han and Wei Xu and Zhengyuan Zhou},
  journal= {arXiv preprint arXiv:2509.22964},
  year   = {2026}
}