中文

基于自私多臂赌博机的无线网络中协作式空间复用

网络与互联网体系结构 2018-11-15 v3

摘要

下一代无线部署以密集且无协调为特征,常导致资源利用低效与性能不佳。为此,我们设想利用完全去中心化机制来实现空间复用(SR)。具体而言,我们聚焦于动态信道选择与发射功率控制(TPC)。我们依托强化学习(RL),更具体地依托多臂赌博机(MABs),使网络能够学习其最佳配置。本文中,我们通过 ε\varepsilon-greedy、EXP3、UCB 与 Thompson 采样动作选择来研究探索-利用权衡,并比较其性能。此外,我们研究在对抗性设置(即并发)中同时选择动作的影响,并与顺序方法进行比较。我们的结果表明,即使学习者无从获取邻网信息且无线网(WNs)自私运行,也可实现最优比例公平。然而,各网络所经历的吞吐量存在高度时间变异性,尤其对于 ε\varepsilon-greedy 与 EXP3。这些策略与 UCB 和 Thompson 采样相反,其运作基于绝对经历奖励而非其分布。我们确定该变异性的成因为本设置的对抗性:最常被采用的动作集合根据邻网决策提供间歇性的好/差性能。我们还表明,即便使用自私策略,顺序学习亦有助于最小化此变异性。因此,顺序方法被证明能有效应对去中心化 WNs 中典型的对抗性设置所带来的挑战。

关键词

引用

@article{arxiv.1710.11403,
  title  = {Collaborative Spatial Reuse in Wireless Networks via Selfish Multi-Armed Bandits},
  author = {Francesc Wilhelmi and Cristina Cano and Gergely Neu and Boris Bellalta and Anders Jonsson and Sergio Barrachina-Muñoz},
  journal= {arXiv preprint arXiv:1710.11403},
  year   = {2018}
}