无先验的黑盒非平稳强化学习可行性研究
机器学习
2025-02-11 v2 人工智能
机器学习
摘要
我们研究了在无关于系统非平稳性先验知识的情况下进行的非平稳强化学习 (NS-RL) 问题。关注名为 MASTER 的前沿黑盒算法,以识别其能实现既定目标的条件。具体而言,我们证明了 MASTER 的非平稳性检测机制在实际时域取值下未被触发,其表现类似于随机重启算法。此外,我们表明 MASTER 的懊悼上界虽然是阶最优的,但在相当大的时域值下仍高于最坏情况下的线性懊悼。为验证这些观察,在针对分段平稳多臂老虎机的特殊情形中测试了 MASTER,以及采用随机重启或最快变化检测进行重启的方法。我们提出了一个简单且阶最优的随机重启算法,该算法拥有关于非平稳性的先验知识。我们在仿真中验证了 MASTER 算法的行为,结果表明采用最快变化检测的方法在鲁棒性和持续性能力上均优于 MASTER 和其他随机重启方法。
引用
@article{arxiv.2410.13772,
title = {Is Prior-Free Black-Box Non-Stationary Reinforcement Learning Feasible?},
author = {Argyrios Gerogiannis and Yu-Han Huang and Venugopal V. Veeravalli},
journal= {arXiv preprint arXiv:2410.13772},
year = {2025}
}
备注
Corrected minor typos in the proof of Theorem 2 on pages 25 and 26