统一随机与对抗情形的背包赌博机问题
机器学习
2018-11-30 v1 计算机科学与博弈论
多智能体系统
机器学习
摘要
本文研究对抗背包赌博机(BwK)在线学习问题,其中玩家重复选择执行某个动作,支付相应代价,并获得与该动作相关的奖励。玩家受可用于执行动作的最大预算 约束,且动作的奖励与代价由对手指定。该问题此前仅在动作奖励大于其代价的受限设定下被研究,而我们给出了一般设定下的解。具体而言,我们提出 EXP3.BwK,一种达到阶最优遗憾的新算法。我们还提出 EXP3++.BwK,它在对抗 BwK 设定下阶最优,并在随机 BwK 设定下以额外 因子取得近乎最优的期望遗憾。最后,我们研究动作代价较大(即与预算规模 相当)的情形,并表明在对抗设定下,与代价以常数有界(BwK 文献中的常见假设)的情形相比,可实现的遗憾界可能显著更差。
引用
@article{arxiv.1811.12253,
title = {Unifying the stochastic and the adversarial Bandits with Knapsack},
author = {Anshuka Rangi and Massimo Franceschetti and Long Tran-Thanh},
journal= {arXiv preprint arXiv:1811.12253},
year = {2018}
}