中文

仅无遗憾还不够!通过自适应遗憾最小化处理带一般约束的Bandit问题

机器学习 2024-05-13 v1 机器学习

摘要

在带背包的臂老虎机(BwK)框架中,学习者有 mm 个资源消耗(打包)约束。我们关注 BwK 的推广形式,其中学习者有一组一般性的长期约束。学习者的目标是在最大化其累积奖励的同时,实现较小的累积约束违反。在此场景下,存在一些简单实例,其中 BwK 的常规方法无法产生次线性的约束违反。我们证明,通过要求原始和对偶算法具有弱自适应性,可以规避此问题。事实上,即使在缺乏表征问题的 Slater 参数 ρ\rho 的任何信息的情况下,弱自适应原始和对偶遗憾最小化器之间的相互作用也会产生对偶变量的“自界”性质。特别地,即使没有显式的投影步骤,它们的范数在整个时间范围内也能保持适当的上界。通过利用这一性质,我们为随机和对抗性输入提供了两全其美的保证。在第一种情况下,我们证明该算法保证了次线性遗憾。在后一种情况下,我们建立了 ρ/(1+ρ)\rho/(1+\rho) 的紧竞争比。在这两种设置下,约束违反都被保证在时间上是次线性的。最后,这些结果使我们能够为带线性约束的上下文臂老虎机问题获得新结果,首次为对抗性上下文提供了无 α\alpha-遗憾保证。

关键词

引用

@article{arxiv.2405.06575,
  title  = {No-Regret is not enough! Bandits with General Constraints through Adaptive Regret Minimization},
  author = {Martino Bernasconi and Matteo Castiglioni and Andrea Celli},
  journal= {arXiv preprint arXiv:2405.06575},
  year   = {2024}
}