RVI-SAC:基于平均奖励的无策略深度强化学习
机器学习
2024-08-06 v1
摘要
本文提出一种基于平均奖励准则的无策略深度强化学习(DRL)方法。虽然大多数现有 DRL 方法采用折扣奖励准则,但这可能导致训练目标与持续任务中的绩效指标之间存在差异,使平均奖励准则成为推荐的替代方案。我们提出 RVI-SAC,将最先进的无策略 DRL 方法软演员-评论家(SAC)扩展至平均奖励准则。我们的方案包括(1)基于 RVI Q-learning 的评论家更新,(2)由平均奖励软策略改进定理引入的演员更新,以及(3)自动调整重置成本,使平均奖励强化学习可用于具有终止条件的任务。我们将该方法应用于 Gymnasium 的 Mujoco 任务,部分为 locomotion 任务,表明 RVI-SAC 在与现有方法的竞争性能方面表现优异。
引用
@article{arxiv.2408.01972,
title = {RVI-SAC: Average Reward Off-Policy Deep Reinforcement Learning},
author = {Yukinari Hisaki and Isao Ono},
journal= {arXiv preprint arXiv:2408.01972},
year = {2024}
}
备注
Accepted at ICML 2024; Code: https://github.com/yhisaki/average-reward-drl