多状态部分可观测无眠_bandit问题的可索引性与滚动策略
机器学习
2021-08-03 v1 系统与控制
系统与控制
摘要
具有部分可观测状态的无眠多臂_bandit(restless multi-armed bandit)在通信系统、信息年龄和推荐系统中有应用。本文研究多状态部分可观测无眠_bandit模型。我们根据决策者可观测的信息考虑三种不同模型——1) 从某个 bandit 的动作中不可观测任何信息;2) 仅对该 bandit 的某一个动作可观测其完美信息,存在一个固定的重启状态,即从所有其他状态转移到该状态;3) 对某个 bandit 的两个动作决策者均可获得完美状态信息,且两个动作分别对应两个重启状态。我们建立了结构性质。我们还证明了模型 2 和 3 的阈值型策略与可索引性。我们提出蒙特卡洛(Monte Carlo, MC)滚动(rollout)策略。我们将其用于模型 2 的 Whittle 指数计算。我们得到了 MC 滚动策略的值函数在时域长度与轨迹数量方面的集中界。我们推导了模型 3 的显式指数公式。最后,针对难以证明可索引性的模型 1,我们描述了蒙特卡洛滚动策略。我们使用短视(myopic)策略、蒙特卡洛滚动策略和 Whittle 指数策略展示了数值算例。我们观察到蒙特卡洛滚动策略是短视策略的良好竞争性策略。
引用
@article{arxiv.2108.00892,
title = {Indexability and Rollout Policy for Multi-State Partially Observable Restless Bandits},
author = {Rahul Meshram and Kesav Kaza},
journal= {arXiv preprint arXiv:2108.00892},
year = {2021}
}
备注
8 pages, submitted to CDC