中文

基于惠特尔指标的 Q 学习与神经网络函数逼近在非平稳多臂老虎机中的有限时间分析

机器学习 2023-10-04 v1 人工智能

摘要

惠特尔指标策略是针对难解的 restless 多臂老虎机(RMAB)问题的一个启发式方法。尽管其在渐近意义上被证明是最优的,但求解惠特尔指标仍然困难。在本文中,我们提出 Neural-Q-Whittle,一种基于惠特尔指标的 RMAB Q 学习算法,采用神经网络函数逼近,它是非线性双时间尺度随机逼近的一个实例,其中 Q 函数值在较快时间尺度上更新,惠特尔指标在较慢时间尺度上更新。尽管深度 Q 学习在经验上取得成功,但 Neural-Q-Whittle 将神经网络与双时间尺度 Q 学习相耦合的非渐近收敛速率在很大程度上仍不清楚。本文提供了 Neural-Q-Whittle 的有限时间分析,其中数据由马尔可夫链生成,Q 函数由 ReLU 神经网络逼近。我们的分析利用李雅普诺夫漂移方法刻画两个耦合参数的演化,而值函数逼近中的非线性进一步要求我们刻画逼近误差。结合这些,得到 Neural-Q-Whittle 的 O(1/k2/3)\mathcal{O}(1/k^{2/3}) 收敛速率,其中 kk 为迭代次数。

关键词

引用

@article{arxiv.2310.02147,
  title  = {Finite-Time Analysis of Whittle Index based Q-Learning for Restless Multi-Armed Bandits with Neural Network Function Approximation},
  author = {Guojun Xiong and Jian Li},
  journal= {arXiv preprint arXiv:2310.02147},
  year   = {2023}
}

备注

26 pages, 4 figures, Neurips 2023