异构无约束多臂赌博机的模型预测控制几乎最优
最优化与控制
2025-11-12 v1 概率论
机器学习
摘要
我们考虑一个通用的无限时程异构无约束多臂赌博机 (RMAB)。异构性是许多实际系统的基本问题,因为它抵抗许多浓度论证。在本文中,我们假设 个臂可以具有不同的模型参数。我们证明,在均匀 Ergodicity 的 mild 假设下,一个自然的有限时程 LP-update 策略,通过随机取整,对原为 Homogeneous 情况下提出的策略,在 fully 异构 RMAB 的无限时间平均奖励问题中实现 的最优间隙。在此过程中,我们提供了对在实际中表现良好且众所周知的算法的强理论保证。LP-update 策略是一种模型预测方法,通过计划时间范围 在时间 计算决策。我们的仿真部分表明,即使 很小且设置为 5,该算法也表现得非常好,这使得其计算效率很高。我们的理论结果基于模型预测控制文献中的技术,借助“dissipativity”的概念,并容易推广到更一般的弱耦合异构马尔可夫决策过程设置。此外,我们在策略与 LP-index 策略之间建立了平行关系,表明 LP-index 策略对应于 。我们描述了后者的短coming 的来源,以及在我们的 mild 假设下我们如何解决这些 shortcoming。我们主定理的证明回答了 Brown 等人 (2020) 提出的开放问题,为若干新的关于 LP-update 策略的问题开辟了道路。
关键词
引用
@article{arxiv.2511.08097,
title = {Model Predictive Control is almost Optimal for Heterogeneous Restless Multi-armed Bandits},
author = {Dheeraj Narasimha and Nicolas Gast},
journal= {arXiv preprint arXiv:2511.08097},
year = {2025}
}