双向 Soft Actor-Critic:利用前向与反向 KL 散度实现高效强化学习
机器学习
2025-06-03 v1 人工智能
摘要
Soft Actor-Critic (SAC) 算法是最大熵强化学习中的一种前沿方法,传统上依赖最小化反向 Kullback-Leibler (KL) 散度进行策略更新。然而,这种方法会导致不可处理的最优投影策略,从而需要基于梯度的近似,这可能带来不稳定性和较差的样本效率。本文研究了在 SAC 中替代使用前向 KL 散度的方法。我们证明,对于高斯策略,前向 KL 散度可产生显式的最优投影策略——对应于目标玻尔兹曼分布动作边缘分布的均值和方差。基于两种 KL 方向的各自优势,我们提出了 Bidirectional SAC 算法,该算法首先利用显式的前向 KL 投影初始化策略,随后通过优化反向 KL 散度对其进行细化。在连续控制基准上的全面实验表明,Bidirectional SAC 显著优于标准 SAC 及其他基线方法,回合奖励最高提升 ,同时提高了样本效率。
引用
@article{arxiv.2506.01639,
title = {Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning},
author = {Yixian Zhang and Huaze Tang and Changxu Wei and Wenbo Ding},
journal= {arXiv preprint arXiv:2506.01639},
year = {2025}
}