状态分离SARSA:一种具有恢复奖励的实用序贯决策算法
机器学习
2024-03-19 v1 机器学习
摘要
尽管许多多臂老虎机算法假设所有臂的奖励在各轮次间保持不变,但这一假设在许多现实场景中并不成立。本文考虑了恢复老虎机(Pike-Burke & Grunewalder, 2019)的设定,其中奖励取决于自上次拉动该臂以来所经过的轮次数。我们提出了一种针对此设定量身定制的新型强化学习(RL)算法,名为状态分离SARSA(SS-SARSA)算法,该算法将轮次视为状态。SS-SARSA算法通过减少Q学习/SARSA所需的状态组合数量来实现高效学习,而后者在大规模RL问题中常遭遇组合爆炸问题。此外,它对奖励结构做了极少的假设,并具有较低的计算复杂度。更进一步,我们在温和假设下证明了其渐近收敛至最优策略。仿真研究展示了我们的算法在各种设定下的优越性能。
引用
@article{arxiv.2403.11520,
title = {State-Separated SARSA: A Practical Sequential Decision-Making Algorithm with Recovering Rewards},
author = {Yuto Tanimoto and Kenji Fukumizu},
journal= {arXiv preprint arXiv:2403.11520},
year = {2024}
}