非随机老虎机中的延迟与合作
机器学习
2016-06-02 v2
摘要
我们研究通信学习智能体网络,它们合作解决一个共同的非随机老虎机问题。智能体使用底层通信网络获取关于其他智能体所选动作的消息,并丢弃那些经过超过 跳到达的消息,其中 为延迟参数。我们引入 \textsc{Exp3-Coop},即 {\sc Exp3} 算法的合作版本,并证明对于 个动作和 个智能体,经过 轮后每智能体平均后悔至多阶为 ,其中 是连通通信图 的 次幂的独立数。我们随后展示,对于任意连通图,当 时后悔界为 ,严格优于非合作智能体的极小极大后悔 。对 更明智的选择导致当 稠密时界可任意接近全信息极小极大后悔 。当 具有稀疏分量时,我们展示 \textsc{Exp3-Coop} 的一个变体,允许智能体根据其于 中的中心性选择参数,严格改善了后悔。最后,作为我们分析的一个副产品,我们给出了带延迟老虎机学习的极小极大后悔的首次刻画。
引用
@article{arxiv.1602.04741,
title = {Delay and Cooperation in Nonstochastic Bandits},
author = {Nicolo' Cesa-Bianchi and Claudio Gentile and Yishay Mansour and Alberto Minora},
journal= {arXiv preprint arXiv:1602.04741},
year = {2016}
}
备注
30 pages