非平稳无模型强化学习中的高效重启
机器学习
2025-10-15 v1
摘要
在这项工作中,我们为无模型非平稳强化学习(RL)提出了三种高效重启范式。我们识别了 Mao 等人(2022)的 RestartQ-UCB 算法重启设计中的两个核心问题:(1)完全遗忘,即重启后关于环境的所有已学信息丢失,以及(2)定时重启,即重启仅在预定义时间发生,而不考虑策略与当前环境动力学的不兼容性。我们引入了三种方法,称为部分重启、自适应重启和选择性重启,以修改算法 RestartQ-UCB 和 RANDOMIZEDQ(Wang 等人,2025)。我们在多个不同环境中发现了接近最优的经验性能,相对于 RestartQ-UCB 将动态遗憾降低了高达 91%。
引用
@article{arxiv.2510.11933,
title = {Efficient Restarts in Non-Stationary Model-Free Reinforcement Learning},
author = {Hiroshi Nonaka and Simon Ambrozak and Sofia R. Miskala-Dinc and Amedeo Ercole and Aviva Prins},
journal= {arXiv preprint arXiv:2510.11933},
year = {2025}
}
备注
This paper contains 19 pages and 3 figures. To be presented at the 2nd Workshop on Aligning Reinforcement Learning Experimentalists and Theorists (ARLET 2025) at NeurIPS 2025