面向移动干预的带网络效应的 restless 多臂_bandit 问题
机器学习
2022-02-01 v1
摘要
受一类广泛的移动干预问题驱动,我们提出并研究了具有网络效应的 restless 多臂_bandit(RMAB)。在我们的模型中,臂是部分可再充能的,并通过图相互连接,因此拉动一个臂也会改善相邻臂的状态,这显著扩展了先前研究的无网络效应、完全再充能_bandit 设定。在移动干预中,网络效应可能由于常规的人口流动(例如在家与工作场所之间通勤)而产生。我们表明,RMAB 中的网络效应引发了现有求解方法未考虑的强奖励耦合。我们提出了一种针对网络化 RMAB 的新求解方法,利用在自然干预效应结构假设下出现的凹性性质。我们给出了该方法在理想设定下最优性的充分条件,并利用真实世界图在三个移动干预领域实证表明其优于最先进的基线。
引用
@article{arxiv.2201.12408,
title = {Networked Restless Multi-Armed Bandits for Mobile Interventions},
author = {Han-Ching Ou and Christoph Siebenbrunner and Jackson Killian and Meredith B Brooks and David Kempe and Yevgeniy Vorobeychik and Milind Tambe},
journal= {arXiv preprint arXiv:2201.12408},
year = {2022}
}