中文

统一随机与对抗情形的背包赌博机问题

机器学习 2018-11-30 v1 计算机科学与博弈论 多智能体系统 机器学习

摘要

本文研究对抗背包赌博机(BwK)在线学习问题,其中玩家重复选择执行某个动作,支付相应代价,并获得与该动作相关的奖励。玩家受可用于执行动作的最大预算 BB 约束,且动作的奖励与代价由对手指定。该问题此前仅在动作奖励大于其代价的受限设定下被研究,而我们给出了一般设定下的解。具体而言,我们提出 EXP3.BwK,一种达到阶最优遗憾的新算法。我们还提出 EXP3++.BwK,它在对抗 BwK 设定下阶最优,并在随机 BwK 设定下以额外 log(B)\log(B) 因子取得近乎最优的期望遗憾。最后,我们研究动作代价较大(即与预算规模 BB 相当)的情形,并表明在对抗设定下,与代价以常数有界(BwK 文献中的常见假设)的情形相比,可实现的遗憾界可能显著更差。

关键词

引用

@article{arxiv.1811.12253,
  title  = {Unifying the stochastic and the adversarial Bandits with Knapsack},
  author = {Anshuka Rangi and Massimo Franceschetti and Long Tran-Thanh},
  journal= {arXiv preprint arXiv:1811.12253},
  year   = {2018}
}