剖析离散 Soft Actor-Critic:局限性与有原则的替代方案
机器学习
2026-05-13 v2 人工智能
摘要
虽然 Soft Actor-Critic(SAC)在连续控制中非常有效,但其离散对应物(DSAC)在 Atari 等具有挑战性的离散动作域上表现不佳。因此,我们从 DSAC 出发,重新审视该设定下 actor-critic 方法的设计。首先,我们确定 actor 与 critic 熵之间的耦合是 DSAC 性能不佳的主要原因。我们证明,仅通过解耦这些组件,DSAC 的性能即可显著提升。受此启发,我们引入了一个灵活的 off-policy actor-critic 框架,该框架将 DSAC 作为特例包含在内,并产生了新的目标。我们的框架允许对 critic 更新使用 m 步 Bellman 算子,并通过将标准策略优化方法与熵正则化相结合来实例化 actor 目标。在理论上,我们证明所提出的方法在表格设定下能保证收敛到最优正则化值函数,推广了先前工作中的结果。在实验上,我们在标准 Atari 游戏上评估了所提出的目标。我们的消融实验表明,与 DSAC 不同,这些目标(包括新的目标)即使没有熵正则化或显式探索机制也能稳健地运行。
引用
@article{arxiv.2509.09838,
title = {Dissecting Discrete Soft Actor-Critic: Limitations and Principled Alternatives},
author = {Reza Asad and Reza Babanezhad and Sharan Vaswani},
journal= {arXiv preprint arXiv:2509.09838},
year = {2026}
}