闪烁多臂老虎机
机器学习
2026-04-28 v2 人工智能
摘要
我们提出闪烁多臂老虎机(Flickering Multi-Armed Bandits, FMAB)以建模环境中行动可用性变化的序列决策,其中下一动作的可访问性受代理人当前选择决定的子集限制。我们通过随机演化图形来形式化这些约束,其中动作限制在局部邻域内。这一 mobility 约束结构 imposes a dual challenge: 信息获取的统计要求和导航的物理开销。我们在 i.i.d. Erd\H{o}s--R\'enyi 和 Edge-Markovian process 下分析 FMAB,提出一种用于稳健探索的两种相位懒随机漫步算法。我们建立高概率亚线性 regret 界限并证明通过匹配信息论下界实现 near-optimality。我们的结果刻画了在 local-move 约束下的学习内在成本,补充以机器人灾难响应仿真。
引用
@article{arxiv.2602.17315,
title = {Flickering Multi-Armed Bandits},
author = {Sourav Chakraborty and Amit Kiran Rege and Claire Monteleoni and Lijun Chen},
journal= {arXiv preprint arXiv:2602.17315},
year = {2026}
}