中文

对抗自适应对手在线 Bandit 学习:从遗憾到策略遗憾

机器学习 2012-07-03 v1 机器学习

摘要

在线学习算法旨在即使输入由对手生成也能进行学习。广泛接受的衡量在线算法学习能力的形式化定义是博弈论中的遗憾概念。我们认为,如果允许对手适应在线算法的行为,标准的遗憾定义就变得不充分。我们定义了策略遗憾这一替代概念,试图提供一种更有意义的方法来衡量在线算法对抗自适应对手的性能。专注于在线 Bandit 设置,我们表明没有任何 Bandit 算法能保证对抗具有无界记忆的自适应对手时获得次线性策略遗憾。另一方面,如果对手的内存是有界的,我们提出了一种通用技术,可将任何具有次线性遗憾界的 Bandit 算法转化为具有次线性策略遗憾界的算法。我们将此结果扩展到其他遗憾变体,如切换遗憾、内部遗憾和交换遗憾。

关键词

引用

@article{arxiv.1206.6400,
  title  = {Online Bandit Learning against an Adaptive Adversary: from Regret to Policy Regret},
  author = {Raman Arora and Ofer Dekel and Ambuj Tewari},
  journal= {arXiv preprint arXiv:1206.6400},
  year   = {2012}
}

备注

Appears in Proceedings of the 29th International Conference on Machine Learning (ICML 2012)