用于快速变化检测的强化学习设计
最优化与控制
2024-09-16 v2 信息论
math.IT
摘要
快速变化检测(QCD)领域涉及设计和分析算法,以实时估计重要事件发生的时间,并识别变化后行为的性质。本文表明,基于强化学习(RL)的方法可以基于任何适应观测的“替代信息状态”进行适配。因此,我们需要同时选择替代信息状态过程和算法。对于前者,基于QCD渐近统计学的丰富理论,存在许多可用的选择。考虑了两种RL设计方法:(i)基于演员-评论家公式的随机梯度下降。该方法在理论上基本完备:算法无偏,并将收敛到局部最小值。然而,研究表明随机梯度的方差可能非常大,需要相应较长的运行时间;(ii)基于投影贝尔曼方程版本的Q学习算法。研究表明该算法是稳定的(在样本路径有界的意义上),并且在温和条件下投影贝尔曼方程的解存在。数值实验验证了这些发现,并为更一般设置下的算法设计提供了路线图。
引用
@article{arxiv.2403.14109,
title = {Reinforcement Learning Design for Quickest Change Detection},
author = {Austin Cooper and Sean Meyn},
journal= {arXiv preprint arXiv:2403.14109},
year = {2024}
}
备注
Preprint version of "Reinforcement Learning Design for Quickest Change Detection", IEEE Conference on Decision and Control, 2024 (to appear)