无演员的演员-批评方法
机器学习
2025-09-26 v1
摘要
演员-批评方法是强化学习(RL)中的核心范式,将策略评估与策略改进相耦合。虽然在许多领域都有效,但这些方法依赖于独立的演员和批评网络,使得训练对架构决策和超参数调优十分敏感。这种复杂性限制了其在需要大规模函数逼近器的场景中的可扩展性。最近,扩散模型被提出作为能够捕捉多模态行为并改进探索的表征性策略,但它们引入了额外的设计选择和计算负担,阻碍了高效部署。我们引入无演员的演员-批评(ACA),一种轻量级框架,消除显式的演员网络,改为从噪声水平的批评网络的梯度场中直接生成动作。该设计在无需演员训练的前提下,保持策略改进与批评最新价值估计的紧密对齐。此外,ACA保留了捕获多样化、多模态行为的能力,而无需依赖基于扩散的演员,实现了简单性与表达性之间的平衡。通过在标准在线RL基准上的大量实验,ACA实现了更有利的学习曲线和具竞争力的性能,相较于标准演员-批评方法和最新的基于扩散的方法,为在线RL提供了一个简单而强大的解决方案。
引用
@article{arxiv.2509.21022,
title = {Actor-Critic without Actor},
author = {Donghyeon Ki and Hee-Jun Ahn and Kyungyoon Kim and Byung-Jun Lee},
journal= {arXiv preprint arXiv:2509.21022},
year = {2025}
}