中文

绕过模拟器:近最优对抗线性上下文_bandit

机器学习 2023-09-06 v1 人工智能 机器学习

摘要

我们考虑对抗线性上下文_bandit问题,其中损失向量被完全对抗性地选择,且每轮动作集(即上下文)从固定分布中抽取。该问题的现有方法要么需要访问模拟器以生成自由的独立同分布上下文,要么达到不优于 O~(T56)\widetilde{O}(T^{\frac{5}{6}}) 的次优后悔界,要么计算效率低。我们极大地改进了这些结果:在无模拟器的情况下实现 O~(T)\widetilde{O}(\sqrt{T}) 的后悔界,同时在每轮动作集较小时保持计算效率。在具有对抗性损失与随机臂可用性的休眠_bandit这一特例中,我们的结果肯定地回答了 Saha 等人 [2020] 提出的关于是否存在具有 poly(d)Tpoly(d)\sqrt{T} 后悔界的多项式时间算法的开放问题。我们的方法自然地处理损失线性至一个加性误设定误差的情况,且我们的后悔界对该误差大小表现出近最优的依赖。

关键词

引用

@article{arxiv.2309.00814,
  title  = {Bypassing the Simulator: Near-Optimal Adversarial Linear Contextual Bandits},
  author = {Haolin Liu and Chen-Yu Wei and Julian Zimmert},
  journal= {arXiv preprint arXiv:2309.00814},
  year   = {2023}
}