多动作休眠_bandit的Q学习拉格朗日策略
机器学习
2021-06-24 v1 人工智能
摘要
多动作休眠多臂bandit(RMABs)是一种用于约束资源分配的强大框架,其中管理着个独立过程。然而,先前工作仅研究已知问题动态的离线设定。我们放宽这一限制性假设,设计了首批利用拉格朗日松弛与Q学习组合在线学习多动作RMAB良好策略的算法。我们的第一种方法MAIQL,将二值动作RMAB中Q学习Whittle索引的方法推广至多动作设定。我们推导了广义更新规则与收敛性证明,并在标准假设下确立MAIQL当时收敛至渐近最优多动作RMAB策略。但MAIQL依赖在两个时间尺度上学习Q函数与索引,导致收敛缓慢且需问题结构方能表现良好。因此,我们设计第二种算法LPQL,通过学习最小化拉格朗日界(Q学习的一种变体)来学习多动作RMAB中表现良好且更通用的拉格朗日策略。为确保快速收敛,我们采用一种近似策略以实现单时间尺度学习,并给出将近似精度与LPQL在时回报上界相关联的保证。最后,我们表明我们的方法在多种设定下(包括一个源自真实世界用药依从性数据的设定)始终优于基线。
引用
@article{arxiv.2106.12024,
title = {Q-Learning Lagrange Policies for Multi-Action Restless Bandits},
author = {Jackson A. Killian and Arpita Biswas and Sanket Shah and Milind Tambe},
journal= {arXiv preprint arXiv:2106.12024},
year = {2021}
}
备注
13 pages, 6 figures, to be published in Proceedings of the 27th ACM SIGKDD Conference on Knowledge Discovery and Data