中文

协作加速 surfing:使用 Co-Bandit!

网络与互联网体系结构 2019-01-24 v1 计算机科学与博弈论

摘要

本文探讨了对抗式 bandit 设定中协作的益处。作为一个激励性示例,我们考虑无线网络选择问题。移动设备常需选择合适的关联网络以获得最优性能,这并非易事。领先的多臂 bandit 算法 EXP3 优异的理论性质表明它应适用于此类问题。然而,它在实践中表现不佳。一个主要局限是其稳定速率慢。当全局知识可用时,即设备在每次选择后收到关于所有网络的反馈时,bandit 式算法表现更好。但不幸的是,向所有设备通信完整信息代价高昂。因此,我们探讨何种信息量足以获得更好性能。我们提出 Co-Bandit,一种新颖的协作 bandit 方法,允许设备偶尔共享其观测并转发来自邻居的反馈;因此,反馈可能延迟收到。设备基于自身观测与来自邻居的反馈执行网络选择。如此,它们加速了彼此的学习速率。我们证明 Co-Bandit 是最小化 regret 的,并保留了具有完整信息的乘性权重更新算法的收敛性质。通过仿真,我们表明极少量的信息,即便有延迟,也足以促使彼此选择正确网络,并在最优状态下实现显著更快的稳定(约为 EXP3 的 630 倍)。

关键词

引用

@article{arxiv.1901.07768,
  title  = {Cooperation Speeds Surfing: Use Co-Bandit!},
  author = {Anuja Meetoo Appavoo and Seth Gilbert and Kian-Lee Tan},
  journal= {arXiv preprint arXiv:1901.07768},
  year   = {2019}
}

备注

Full version of paper; Full version of submission "submit/2535150"