强化学习中的平稳性检验与变点检测
机器学习
2025-01-07 v4 机器学习
摘要
我们考虑在可能非平稳环境中的离线强化学习(RL)方法。文献中许多现有 RL 算法依赖于平稳性假设,要求系统转移与奖励函数随时间恒定。然而,平稳性假设在实践中具有限制性,并可能在包括交通信号控制、机器人与移动健康在内的若干应用中被违背。本文中,我们基于预先收集的历史数据,无需额外在线数据收集,发展了检验最优 Q 函数非平稳性的一致程序。基于所提出的检验,我们进一步开发了可自然地与现有最先进 RL 方法结合用于非平稳环境下策略优化的序贯变点检测方法。我们方法的有效性由理论结果、仿真研究以及来自 2018 年实习生健康研究的真实数据示例所阐明。所提程序的 Python 实现可在 https://github.com/limengbinggz/CUSUM-RL 获取。
引用
@article{arxiv.2203.01707,
title = {Testing Stationarity and Change Point Detection in Reinforcement Learning},
author = {Mengbing Li and Chengchun Shi and Zhenke Wu and Piotr Fryzlewicz},
journal= {arXiv preprint arXiv:2203.01707},
year = {2025}
}