中文

未知上下文分布下上下文赌博机的最优交叉学习

机器学习 2024-01-04 v1 机器学习

摘要

我们考虑在 Balseiro 等人提出的“交叉学习”设定下设计上下文赌博机算法的问题,其中学习器能观察到其所采取动作在所有可能上下文中的损失,而不仅仅是当前轮次的上下文。我们特别考虑损失由对手选择、上下文从未知分布中独立同分布采样的设定。在此设定下,我们解决了 Balseiro 等人提出的一个开放问题,提供了一个高效算法,其遗憾界为 O~(TK)\widetilde{O}(\sqrt{TK})(接近紧界,至多相差对数因子),且与上下文数量无关。由此,我们首次为在首价拍卖中学习出价(在未知价值分布下)以及具有随机动作集的休眠赌博机问题给出了接近紧的遗憾界。我们算法的核心是一种新颖的技术,用于协调学习算法在多个周期内的执行,以消除未知分布估计与算法所采取动作之间的相关性。该技术可能对其他涉及未知上下文分布估计的学习问题具有独立的研究价值。

关键词

引用

@article{arxiv.2401.01857,
  title  = {Optimal cross-learning for contextual bandits with unknown context distributions},
  author = {Jon Schneider and Julian Zimmert},
  journal= {arXiv preprint arXiv:2401.01857},
  year   = {2024}
}

备注

Appeared at NeurIPS 2023