平均奖励非平稳多臂赌博机的拉格朗日指数策略
机器学习
2026-01-01 v3 人工智能
最优化与控制
概率论
摘要
我们研究了具有长期平均奖励的非平稳多臂赌博机的拉格朗日指数策略(Lagrangian Index Policy, LIP)。具体而言,我们比较了 LIP 与 Whittle 指数策略(Whittle Index Policy, WIP)的性能,两者均为已知在某些自然条件下具有渐近最优性的启发式策略。尽管在大多数情况下它们的性能非常相似,但在 WIP 表现不佳的情况下,LIP 依然保持良好的表现。随后,我们提出了基于表格和神经网络的强化学习算法,以在无模型环境下获取 LIP 的在线学习方案。为 LIP 提出的强化学习方案所需的内存显著少于 WIP 的类似方案。我们解析计算了重启模型的拉格朗日指数,该模型适用于最优网络爬取和信息年龄最小化。此外,基于可交换性和 de Finetti 定理,我们给出了当臂数趋于无穷大时同质臂渐近最优性的新证明。
引用
@article{arxiv.2412.12641,
title = {Lagrangian Index Policy for Restless Bandits with Average Reward},
author = {Konstantin Avrachenkov and Vivek S. Borkar and Pratik Shah},
journal= {arXiv preprint arXiv:2412.12641},
year = {2026}
}