基于线性规划的多臂赌博机抽样策略:考虑侧观测与随机可用性
机器学习
2026-03-30 v1 系统与控制
系统与控制
摘要
我们研究了 stochastic 多臂赌博机(MAB)问题,其中底层网络结构 enables 跨相关动作的侧观测。我们使用二分图将动作链接到一组未知数,例如,选择某个动作会揭示其所连接的所有未知数的观测结果。虽然以往研究假设所有动作始终可用,但我们关注更实际的随机可用性场景,即可行动作集合("激活集合")在每个轮次中动态变化。该框架建模了具有结构依赖性和波动性的系统,例如社交网络中用户虽不时不在线以查询,但会就其同行偏好提供侧信息。为应对这一挑战,我们提出了 UCB-LP-A,一种新型策略,利用线性规划(LP)方法在随机可用性下优化探索-开发权衡。不同于假设恒定访问的标准网络赌博机算法,UCB-LP-A 计算实际可激活集合的最优抽样分布,确保仅通过当前激活的臂位即可收集必要观测。我们推导了该策略的 regret 上界,刻画了网络结构和激活概率的影响。最后,通过数值仿真显示,UCB-LP-A 在忽略侧信息或可用性约束的现有启发式方法之上显著优于表现。
引用
@article{arxiv.2603.26647,
title = {An LP-based Sampling Policy for Multi-Armed Bandits with Side-Observations and Stochastic Availability},
author = {Ashutosh Soni and Peizhong Ju and Atilla Eryilmaz and Ness B. Shroff},
journal= {arXiv preprint arXiv:2603.26647},
year = {2026}
}