中文

主动上下文选择改善上下文赌博机中的简单遗憾

机器学习 2026-05-20 v1

摘要

我们研究了具有有限上下文空间(即子群体)的上下文多臂赌博机问题,其中学习者为每个上下文推荐一个最佳动作,并通过上下文加权的简单遗憾进行评估。我们的保证在最坏情况下的奖励分布上成立,同时相对于上下文分布向量 pp 保持实例依赖性。类似于实验设计问题,其中感兴趣的总体是固定的,但采样的子群体可以控制,我们允许学习者主动选择从哪个上下文进行采样。对于已知的 pp,我们刻画了紧致的遗憾率:被动采样(上下文随机揭示)实现的遗憾率为 n/Tp1/2\sqrt{n/T \, \lVert p \rVert_{1/2}} 量级,而采用分配 qjpj2/3q_j \propto p_j^{2/3} 的主动采样则实现了紧致率 n/Tp2/3\sqrt{n/T} \, \lVert p \rVert_{2/3}。由此带来的改进可达 Θ(k1/4)\Theta(k^{1/4}),其中 kk 是上下文的数量。我们进一步将分析扩展到预算受限的主动采样,刻画了相应的紧致率,并确定了有限的主动预算何时足以恢复完全主动率。当 pp 未知时,我们提出了探索-探索-然后承诺 (EETC) 算法,该算法最优地平衡了估计上下文分布和切换到主动分配的时间,使得在足够大的时间范围内,其性能与已知 pp 的主动率相匹配,仅相差常数因子。在合成数据和真实世界数据上的实验支持了我们的理论发现。

关键词

引用

@article{arxiv.2605.20040,
  title  = {Active Context Selection Improves Simple Regret in Contextual Bandits},
  author = {Mohammad Shahverdikondori and Jalal Etesami and Negar Kiyavash},
  journal= {arXiv preprint arXiv:2605.20040},
  year   = {2026}
}