中文

异构无约束多臂赌博机的模型预测控制几乎最优

最优化与控制 2025-11-12 v1 概率论 机器学习

摘要

我们考虑一个通用的无限时程异构无约束多臂赌博机 (RMAB)。异构性是许多实际系统的基本问题,因为它抵抗许多浓度论证。在本文中,我们假设 NN 个臂可以具有不同的模型参数。我们证明,在均匀 Ergodicity 的 mild 假设下,一个自然的有限时程 LP-update 策略,通过随机取整,对原为 Homogeneous 情况下提出的策略,在 fully 异构 RMAB 的无限时间平均奖励问题中实现 O(logN1/N)O(\log N\sqrt{1/N}) 的最优间隙。在此过程中,我们提供了对在实际中表现良好且众所周知的算法的强理论保证。LP-update 策略是一种模型预测方法,通过计划时间范围 {tt+τ}\{t\dots t+\tau\} 在时间 tt 计算决策。我们的仿真部分表明,即使 τ\tau 很小且设置为 5,该算法也表现得非常好,这使得其计算效率很高。我们的理论结果基于模型预测控制文献中的技术,借助“dissipativity”的概念,并容易推广到更一般的弱耦合异构马尔可夫决策过程设置。此外,我们在策略与 LP-index 策略之间建立了平行关系,表明 LP-index 策略对应于 τ=1\tau=1。我们描述了后者的短coming 的来源,以及在我们的 mild 假设下我们如何解决这些 shortcoming。我们主定理的证明回答了 Brown 等人 (2020) 提出的开放问题,为若干新的关于 LP-update 策略的问题开辟了道路。

关键词

引用

@article{arxiv.2511.08097,
  title  = {Model Predictive Control is almost Optimal for Heterogeneous Restless Multi-armed Bandits},
  author = {Dheeraj Narasimha and Nicolas Gast},
  journal= {arXiv preprint arXiv:2511.08097},
  year   = {2025}
}