平均奖励 Soft Actor-Critic
机器学习
2025-08-06 v2 人工智能
摘要
平均奖励强化学习 (RL) 形式近年来因其能够在不依赖折扣因子的情况下解决时延长问题而受到 increased interest。而在折扣设置下,已开发出具有熵正则化的算法,相较于确定性方法取得了改进。尽管这些方法各自都有显著优势,但针对熵正则化平均奖励目标的深度 RL 算法尚未得到开发。虽然最近提出了针对平均奖励文献中的 policy-gradient 方法,但相应的 actor-critic 框架仍较少被探索。本文引入一种平均奖励 soft actor-critic 算法,以解决该领域的这些问题。我们通过在标准 RL 基准任务上与现有平均奖励算法进行比较,验证了该方法的有效性,在平均奖励准则下实现了优异的性能。
引用
@article{arxiv.2501.09080,
title = {Average-Reward Soft Actor-Critic},
author = {Jacob Adamczyk and Volodymyr Makarenko and Stas Tiomkin and Rahul V. Kulkarni},
journal= {arXiv preprint arXiv:2501.09080},
year = {2025}
}
备注
Accepted at the 2nd Reinforcement Learning Conference (Journal Track)