中文

有限状态 restless 多臂_bandit 的可索引性与 rollout 策略

机器学习 2023-05-02 v1 系统与控制 系统与控制 机器学习

摘要

我们考虑有限状态 restless 多臂_bandit 问题。决策者在每个时间步可以对 N 个臂中的 M 个臂采取行动。臂被拉动(活跃臂)时根据动作产生状态依赖的奖励,而当臂未被拉动时,也根据状态和动作提供奖励。决策者的目标是最大化无限 horizon 折扣奖励。restless _bandit 的经典方法是 Whittle 索引 策略。在该策略中,每个时间步拉动具有最高索引的 M 个臂。这里,我们通过分析松弛约束的 restless _bandit 问题来解耦 restless _bandit 问题。然后通过拉格朗日松弛问题,将 restless _bandit 问题解耦为 N 个单臂 restless _bandit 问题。我们分析单臂 restless _bandit。为了研究 Whittle 索引 策略,我们给出了单臂 bandit 模型的结构性结果。我们定义可索引性,并证明了若干特殊情况下的可索引性。我们提出了一种利用值迭代算法验证单臂 bandit 模型可索引准则的替代方法。我们用不同例子展示了我们算法的性能。我们利用关于转移概率和奖励矩阵的不同结构假设,给出了 restless _bandit 可索引性条件的见解。我们还研究了在线 rollout 策略,讨论了算法的计算复杂度,并与索引计算复杂度进行了比较。数值例子表明,索引策略和 rollout 策略优于短视策略。

关键词

引用

@article{arxiv.2305.00410,
  title  = {Indexability of Finite State Restless Multi-Armed Bandit and Rollout Policy},
  author = {Vishesh Mittal and Rahul Meshram and Deepak Dev and Surya Prakash},
  journal= {arXiv preprint arXiv:2305.00410},
  year   = {2023}
}

备注

15 Pages, submitted to conference