中文

利用有界臂记忆在多臂老虎机中进行遗憾最小化

机器学习 2019-01-25 v1 人工智能

摘要

在本文中,我们提出了一种常数字(RAM 模型)算法,用于有限和无限随机多臂老虎机(MAB)实例的遗憾最小化。大多数现有的遗憾最小化算法需要记住它们遇到的所有臂的统计量。在可用内存字数有限的情况下,这可能成为一个问题。设计一个使用常数个字数的高效遗憾最小化算法长期以来令学界感兴趣。一些早期尝试考虑臂的数量为无限,并要求臂的奖励分布属于某个特定族。最近,对于有限多臂老虎机,一种基于探索后提交(explore-then-commit)的算法~\citep{Liau+PSY:2018} 似乎摆脱了此类假设。然而,由于其底层的基于 PAC 的消除,它们的方法产生了高遗憾。我们提出了一种概念上简单且高效的算法,它只需记住至多 MM 个臂的统计量,并且对于任何 KK 臂有限老虎机实例,其遗憾上具有 O(KM+K1.5Tlog(T/MK)/M)O(KM +K^{1.5}\sqrt{T\log (T/MK)}/M) 的上界。我们将其扩展以实现次线性 \textit{分位遗憾}(quantile-regret)~\citep{RoyChaudhuri+K:2018},并通过实验经验性地验证了算法的效率。

关键词

引用

@article{arxiv.1901.08387,
  title  = {Regret Minimisation in Multi-Armed Bandits Using Bounded Arm Memory},
  author = {Arghya Roy Chaudhuri and Shivaram Kalyanakrishnan},
  journal= {arXiv preprint arXiv:1901.08387},
  year   = {2019}
}