中文

关于为具有可扩展遗憾值的 restleess bandit 学习 Whittle 索引策略

机器学习 2023-04-28 v2 系统与控制 系统与控制

摘要

当系统模型未知时,强化学习是一种基于数据学习良好资源分配与调度策略的极具吸引力的方法。然而,大多数 RL 算法的累积遗憾随 O~(SAT)\tilde O(\mathsf{S} \sqrt{\mathsf{A} T}) 缩放,其中 S\mathsf{S} 为状态空间大小,A\mathsf{A} 为动作空间大小,TT 为时域,且 O~()\tilde{O}(\cdot) 记号隐藏了对数项。由于对状态空间大小的线性依赖,这些遗憾界对于资源分配与调度问题而言大得 prohibitive。在本文中,我们针对此类问题提出一种具有可扩展遗憾的基于模型的 RL 算法。具体地,我们考虑 restless bandit 模型,并提出一种基于 Thompson 采样、针对模型底层结构调优的学习算法。我们针对 Whittle 索引 策略给出了所提算法遗憾的两种刻画。首先,我们表明对于具有 nn 个臂且每时刻至多 mm 次激活的 restless bandit,根据奖励模型不同,遗憾要么按 O~(mnT)\tilde{O}(mn\sqrt{T}) 缩放,要么按 O~(n2T)\tilde{O}(n^2 \sqrt{T}) 缩放。其次,在额外技术假设下,我们表明遗憾按 O~(n1.5T)\tilde{O}(n^{1.5} \sqrt{T})O~(max{mn,n}T)\tilde{O}(\max\{m\sqrt{n}, n\} \sqrt{T}) 缩放。我们给出数值例子以阐明该算法的显著特征。

关键词

引用

@article{arxiv.2202.03463,
  title  = {On learning Whittle index policy for restless bandits with scalable regret},
  author = {Nima Akbarzadeh and Aditya Mahajan},
  journal= {arXiv preprint arXiv:2202.03463},
  year   = {2023}
}