SMDP 中平均收益强化学习的调和均值表述
机器学习
2026-05-27 v1 人工智能
摘要
近期的研究重新激发并扩大了对无限 horizon、非情景式(连续)任务中无折扣平均收益强化学习算法的兴趣。半马尔可夫决策过程(SMDP)尤其受到关注。在 SMDP 中,离散动作随机地生成收益和持续时间,目标是优化平均收益率。现有算法通过优化收益与持续时间的比值来处理此问题。然而,当收益和持续时间是非平稳的(在无限 horizon 内),这可能是错误的。本文提出了一种新颖的修正调和均值算子,即使在此类条件下也能正确计算收益率。这产生了可适用于 SMDP 的无模型学习算法,同时保持对随时间非平稳的收益和持续时间分布的鲁棒性。我们证明了修正调和均值算子的理论性质,并实证展示了其相较于现有算法的有效性。
引用
@article{arxiv.2605.04880,
title = {A Harmonic Mean Formulation of Average Reward Reinforcement Learning in SMDPs},
author = {Erel Shtossel and Alicia Vidler and Uri Shaham and Gal A. Kaminka},
journal= {arXiv preprint arXiv:2605.04880},
year = {2026}
}