SACn:带n步回报的软演员-评论家算法
机器学习
2025-12-16 v1 人工智能
摘要
软演员-评论家(SAC)在实际应用中广泛使用,目前是最相关的离线策略在线无模型强化学习(RL)方法之一。n 步回报技术已知可提高 RL 算法的收敛速度,相比其基于 1 步回报的版本。然而,SAC 与 n 步回报的结合众所周知难以实现,因为其常规组合由于动作分布的变化而在离线策略算法中引入偏差。虽然该问题可通过重要性采样解决——即利用来自另一分布的样本来估计期望值——但重要性采样可能导致数值不稳定。在本工作中,我们以克服该问题的方式将 SAC 与 n 步回报相结合。我们提出了一种应用数值稳定重要性采样的方法,并简化了超参数选择。此外,我们在 n 步最大熵框架的背景下分析了软演员-评论家的熵估计方法,并提出了 τ 采样熵估计以降低学习目标的方差。最后,我们给出了软演员-评论家带 n 步回报(SACn)算法,并在 MuJoCo 仿真环境中进行了实验验证。
引用
@article{arxiv.2512.13165,
title = {SACn: Soft Actor-Critic with n-step Returns},
author = {Jakub Łyskawa and Jakub Lewandowski and Paweł Wawrzyński},
journal= {arXiv preprint arXiv:2512.13165},
year = {2025}
}
备注
Accepted at ICAART 2026