中文

随机组合部分监测博弈中的分阶段探索与贪心利用

计算机科学与博弈论 2016-08-24 v1 人工智能

摘要

部分监测博弈是一类重复博弈,其中学习者收到的反馈可能与对手的动作甚至学习者获得的奖励不同。最近,一种组合部分监测 (CPM) 博弈的通用模型被提出 \cite{lincombinatorial2014},其中学习者的动作空间可以是指数级大的,而对手根据一个固定分布从一个有界连续空间中采样其动作。该论文给出了一个基于置信界的算法 (GCB),该算法实现了 O(T2/3logT)O(T^{2/3}\log T) 的分布无关悔值界和 O(logT)O(\log T) 的分布相关悔值界。其算法的实现依赖于两个独立的离线预言机,且分布相关悔值额外要求学习者存在唯一的最优动作。采用他们的 CPM 模型,我们的第一个贡献是针对该问题的一个分阶段探索与贪心利用 (PEGE) 算法框架。该框架内的不同算法分别实现了 O(T2/3logT)O(T^{2/3}\sqrt{\log T}) 的分布无关悔值和 O(log2T)O(\log^2 T) 的分布相关悔值。至关重要的是,我们的框架仅需要 GCB 中更简单的 "argmax" 预言机,且分布相关悔值不要求存在唯一的最优动作。我们的第二个贡献是另一个算法 PEGE2,它将间隙估计与 PEGE 算法相结合,实现了 O(logT)O(\log T) 的悔值界,匹配了 GCB 的保证但移除了对学习者动作空间大小的依赖。然而,与 GCB 一样,PEGE2 需要访问两个离线预言机且要求存在唯一的最优动作。最后,我们讨论了如何将我们的算法高效地应用于一个具有实际意义的 CPM 问题:即带有顶部反馈的在线排名。

关键词

引用

@article{arxiv.1608.06403,
  title  = {Phased Exploration with Greedy Exploitation in Stochastic Combinatorial Partial Monitoring Games},
  author = {Sougata Chaudhuri and Ambuj Tewari},
  journal= {arXiv preprint arXiv:1608.06403},
  year   = {2016}
}

备注

Appearing in NIPS 2016