基于隐式再参数化梯度的Beta策略Soft Actor-Critic
机器学习
2024-09-10 v1 人工智能
摘要
近期深度强化学习的进展在广泛的复杂任务中取得了令人印象深刻的结果,但样本效率仍是实际部署的主要障碍。Soft actor-critic (SAC)通过结合随机策略优化和离策略学习来缓解这一问题,但其适用性受限于可以通过再参数化技巧计算梯度的分布。此限制排除了诸如Beta分布等重要示例,因为其有界支持被证明可提高高维连续控制问题中actor-critic算法的收敛速度。为此,我们研究使用隐式再参数化梯度的技术,这是一种扩展再参数化分布类的强大方法。具体而言,我们使用隐式再参数化梯度在模拟机器人 locomotion 环境中训练SAC的Beta策略,并与常见基线进行比较。实验结果表明,Beta策略是一种可行的替代方案,因为它超越了normal policy,同时与squaded normal policy表现相当,而后者是SAC的首选选择。代码已提供:https://github.com/lucadellib/sac-beta。
引用
@article{arxiv.2409.04971,
title = {Soft Actor-Critic with Beta Policy via Implicit Reparameterization Gradients},
author = {Luca Della Libera},
journal= {arXiv preprint arXiv:2409.04971},
year = {2024}
}
备注
10 pages