主动上下文选择改善上下文赌博机中的简单遗憾
机器学习
2026-05-20 v1
摘要
我们研究了具有有限上下文空间(即子群体)的上下文多臂赌博机问题,其中学习者为每个上下文推荐一个最佳动作,并通过上下文加权的简单遗憾进行评估。我们的保证在最坏情况下的奖励分布上成立,同时相对于上下文分布向量 保持实例依赖性。类似于实验设计问题,其中感兴趣的总体是固定的,但采样的子群体可以控制,我们允许学习者主动选择从哪个上下文进行采样。对于已知的 ,我们刻画了紧致的遗憾率:被动采样(上下文随机揭示)实现的遗憾率为 量级,而采用分配 的主动采样则实现了紧致率 。由此带来的改进可达 ,其中 是上下文的数量。我们进一步将分析扩展到预算受限的主动采样,刻画了相应的紧致率,并确定了有限的主动预算何时足以恢复完全主动率。当 未知时,我们提出了探索-探索-然后承诺 (EETC) 算法,该算法最优地平衡了估计上下文分布和切换到主动分配的时间,使得在足够大的时间范围内,其性能与已知 的主动率相匹配,仅相差常数因子。在合成数据和真实世界数据上的实验支持了我们的理论发现。
引用
@article{arxiv.2605.20040,
title = {Active Context Selection Improves Simple Regret in Contextual Bandits},
author = {Mohammad Shahverdikondori and Jalal Etesami and Negar Kiyavash},
journal= {arXiv preprint arXiv:2605.20040},
year = {2026}
}