中文

基于多臂赌博机的去中心化接入点选择:带粘滞性的机会主义 ε-Greedy 方法

网络与互联网体系结构 2019-03-04 v1

摘要

WiFi 密集化导致多个重叠覆盖区域的存在,使得用户站(STA)可在不同接入点(AP)之间进行选择。标准 WiFi 关联方法使 STA 选择信号最强的 AP,这在许多情况下导致部分 AP 利用不足而另一些过度拥挤。为缓解此状况,可使用多臂赌博机(Multi-Armed Bandits)等强化学习技术动态学习 AP 与 STA 之间的最优映射,从而相应地在可用 AP 间重新分配 STA。这是一个尤其具有挑战性的问题,因为给定 STA 观测到的网络响应依赖于其他 STA 的行为,因此在没有网络全局视图时很难预测。本文聚焦于以去中心化方式解决该问题,其中 STA 独立探索其覆盖范围内的不同 AP,并选择最能满足其需求的那个。为此,我们提出一种称为带粘滞性的机会主义 ε-greedy(Opportunistic ε-greedy with Stickiness)的新方法:当找到合适的 AP 时停止探索,然后在 STA 满意期间保持与之关联,仅在不满意的关联周期多次出现后才恢复探索。借助该方法,我们显著降低了网络响应的波动性,提升了 STA 更快找到解决方案的能力,并实现了网络资源的更高效利用。

关键词

引用

@article{arxiv.1903.00281,
  title  = {Decentralized AP selection using Multi-Armed Bandits: Opportunistic {\epsilon}-Greedy with Stickiness},
  author = {Marc Carrascosa and Boris Bellalta},
  journal= {arXiv preprint arXiv:1903.00281},
  year   = {2019}
}