无限视界非静息多臂老虎机的最优控制方法:在最小假设下实现渐近最优
最优化与控制
2024-03-19 v1 动力系统
概率论
摘要
我们采用最优控制框架来解决无折扣无限视界离散时间非静息 臂老虎机问题。与大多数依赖于基于松弛的单臂 Markov 决策过程(MDP)构建策略的研究不同,我们提出通过确定性等价控制原理将整个老虎机 MDP 松弛为一个最优控制问题。我们的主要贡献是证明,最优控制问题中最优平稳状态的可达性是渐近最优策略存在的充分条件。这种策略可以使用“对齐与引导”策略来设计。这一可达性假设比对臂级 MDP 施加的任何先前假设都要弱,特别是不再需要单链条件。通过数值算例,我们表明采用模型预测控制进行引导通常比其他现有策略产生更优的性能。
引用
@article{arxiv.2403.11913,
title = {An Optimal-Control Approach to Infinite-Horizon Restless Bandits: Achieving Asymptotic Optimality with Minimal Assumptions},
author = {Chen YAN},
journal= {arXiv preprint arXiv:2403.11913},
year = {2024}
}
备注
10 pages, 3 figures, submitted to CDC 2024