中文

用于Whittle指数的表格型与深度学习方法

人工智能 2024-06-05 v1 机器学习

摘要

Whittle指数策略是一种启发式方法,在应用于称为“ restless多臂赌博机问题”(RMABPs)的问题类别时,表现出非常良好的性能(具有保证的渐近最优性)。在本文中,我们提出了 QWI 和 QWINN,两种强化学习算法,分别是表格型和深度型,用于学习总折扣准则下的 Whittle 指数。关键特征是使用两个时间尺度,一个较快的尺度用于更新状态-动作 Q 值,另一个相对较慢的尺度用于更新 Whittle 指数。在我们的主要理论结果中,我们证明了 QWI(一种表格型实现)收敛到真实的 Whittle 指数。然后,我们提出了 QWINN,它是 QWI 算法的一种改编,使用神经网络在较快的时间尺度上计算 Q 值,能够从一个状态外推信息到另一个状态,并自然地扩展到大规模状态空间环境。对于 QWINN,我们证明了 Bellman 误差的所有局部最小值都是局部稳定的平衡点,这是基于 DQN 的方案中的首个此类结果。数值计算表明,QWI 和 QWINN 比标准的 Q 学习算法、基于神经网络的近似 Q 学习以及其他最先进算法收敛得更快。

关键词

引用

@article{arxiv.2406.02057,
  title  = {Tabular and Deep Learning for the Whittle Index},
  author = {Francisco Robledo Relaño and Vivek Borkar and Urtzi Ayesta and Konstantin Avrachenkov},
  journal= {arXiv preprint arXiv:2406.02057},
  year   = {2024}
}

备注

ACM Transactions on Modeling and Performance Evaluation of Computing Systems, 2024