中文

非随机老虎机中的延迟与合作

机器学习 2016-06-02 v2

摘要

我们研究通信学习智能体网络,它们合作解决一个共同的非随机老虎机问题。智能体使用底层通信网络获取关于其他智能体所选动作的消息,并丢弃那些经过超过 dd 跳到达的消息,其中 dd 为延迟参数。我们引入 \textsc{Exp3-Coop},即 {\sc Exp3} 算法的合作版本,并证明对于 KK 个动作和 NN 个智能体,经过 TT 轮后每智能体平均后悔至多阶为 (d+1+KNαd)(TlnK)\sqrt{\bigl(d+1 + \tfrac{K}{N}\alpha_{\le d}\bigr)(T\ln K)},其中 αd\alpha_{\le d} 是连通通信图 GGdd 次幂的独立数。我们随后展示,对于任意连通图,当 d=Kd=\sqrt{K} 时后悔界为 K1/4TK^{1/4}\sqrt{T},严格优于非合作智能体的极小极大后悔 KT\sqrt{KT}。对 dd 更明智的选择导致当 GG 稠密时界可任意接近全信息极小极大后悔 TlnK\sqrt{T\ln K}。当 GG 具有稀疏分量时,我们展示 \textsc{Exp3-Coop} 的一个变体,允许智能体根据其于 GG 中的中心性选择参数,严格改善了后悔。最后,作为我们分析的一个副产品,我们给出了带延迟老虎机学习的极小极大后悔的首次刻画。

关键词

引用

@article{arxiv.1602.04741,
  title  = {Delay and Cooperation in Nonstochastic Bandits},
  author = {Nicolo' Cesa-Bianchi and Claudio Gentile and Yishay Mansour and Alberto Minora},
  journal= {arXiv preprint arXiv:1602.04741},
  year   = {2016}
}

备注

30 pages