中文

多动作部分可观测无回报多臂老虎机问题的拉格朗日松弛:启发式策略与可索引性

机器学习 2025-09-03 v1 系统与控制 系统与控制

摘要

部分可观测无回报多臂老虎机问题在推荐系统、通信系统、公共卫生 outreach 系统以及运筹学研究中得到了众多应用。我们研究的是多动作部分可观测无回报多臂老虎机问题,这是经典无回报多臂老虎机问题的推广——1)每个老虎机具有有限状态,且当前状态不可观测;2)每个老虎机具有有限动作,特别是每个老虎机可用的动作数超过两个。我们以公共卫生干预规划为应用场景,对该问题进行建模并构建了长期折扣优化问题,其中每个老虎机的状态依据马尔可夫过程演化,且该演化过程与动作相关。老虎机的状态不可观测,但可观测有限多个反馈信号。每个老虎机根据所采取的动作产生奖励。假设智能体受预算约束。假设所有老虎机相互独立,但通过预算约束在智能体层面发生弱耦合。我们首先分析拉格朗日 bound 方法用于部分可观测无回报老虎机。有限状态、有限动作的 POMDP 的最优值函数的计算是非平凡的,因此拉格朗日 bound 的计算也面临挑战。我们描述了使用点基值迭代 (PBVI) 和在线 rollout 策略进行拉格朗日 bound 计算的近似方法。我们进一步介绍了价值函数的各种性质,并对 PBVI 和在线 rollout 策略提供了理论见解。我们研究了多动作 PORMAB 的启发式策略。最后,我们讨论了现有的Whittle index 策略及其在本模型中的局限性。

关键词

引用

@article{arxiv.2509.00415,
  title  = {Lagrangian Relaxation for Multi-Action Partially Observable Restless Bandits: Heuristic Policies and Indexability},
  author = {Rahul Meshram and Kesav Kaza},
  journal= {arXiv preprint arXiv:2509.00415},
  year   = {2025}
}

备注

13 pages