基于惠特尔指标的 Q 学习与神经网络函数逼近在非平稳多臂老虎机中的有限时间分析
机器学习
2023-10-04 v1 人工智能
摘要
惠特尔指标策略是针对难解的 restless 多臂老虎机(RMAB)问题的一个启发式方法。尽管其在渐近意义上被证明是最优的,但求解惠特尔指标仍然困难。在本文中,我们提出 Neural-Q-Whittle,一种基于惠特尔指标的 RMAB Q 学习算法,采用神经网络函数逼近,它是非线性双时间尺度随机逼近的一个实例,其中 Q 函数值在较快时间尺度上更新,惠特尔指标在较慢时间尺度上更新。尽管深度 Q 学习在经验上取得成功,但 Neural-Q-Whittle 将神经网络与双时间尺度 Q 学习相耦合的非渐近收敛速率在很大程度上仍不清楚。本文提供了 Neural-Q-Whittle 的有限时间分析,其中数据由马尔可夫链生成,Q 函数由 ReLU 神经网络逼近。我们的分析利用李雅普诺夫漂移方法刻画两个耦合参数的演化,而值函数逼近中的非线性进一步要求我们刻画逼近误差。结合这些,得到 Neural-Q-Whittle 的 收敛速率,其中 为迭代次数。
引用
@article{arxiv.2310.02147,
title = {Finite-Time Analysis of Whittle Index based Q-Learning for Restless Multi-Armed Bandits with Neural Network Function Approximation},
author = {Guojun Xiong and Jian Li},
journal= {arXiv preprint arXiv:2310.02147},
year = {2023}
}
备注
26 pages, 4 figures, Neurips 2023