基于竞争驱动特征提取的 WLAN 信道分配惩罚式去中心化上下文_bandit 学习
网络与互联网体系结构
2021-12-02 v5 信号处理
摘要
本研究提出一种基于上下文多臂_bandit(CMAB)的去中心化信道探索框架,将信道效用函数(即奖励)相对于竞争邻居接入点(AP)解耦。该框架使 AP 能对竞争 AP 的观测奖励进行组合式评估,从而既对邻居 AP 信道变化引起的奖励波动具有鲁棒性,也能评估即便未探索过的信道。为实现该框架,我们提出竞争驱动特征提取(CDFE),其在竞争下提取 AP 间的邻接关系,并构成以解耦形式表达奖励函数的基础,即与竞争下邻居 AP 相关联参数的线性组合。这使得 CMAB 能与联合线性上置信界(JLinUCB)探索结合,并深入探究所提框架的有效性。此外,我们基于在学习轮次前后利用不同信道时给奖励引入折扣参数的核心思想,提出惩罚式 JLinUCB(P-JLinUCB),以解决非收敛问题——即信道探索循环。数值评估证实,所提方法通过 CDFE 使 AP 对奖励波动具有鲁棒性的信道质量评估能力,并通过 P-JLinUCB 获得更优收敛特性。
引用
@article{arxiv.2003.10094,
title = {Penalized and Decentralized Contextual Bandit Learning for WLAN Channel Allocation with Contention-Driven Feature Extraction},
author = {Kota Yamashita and Shotaro Kamiya and Koji Yamamoto and Yusuke Koda and Takayuki Nishio and Masahiro Morikura},
journal= {arXiv preprint arXiv:2003.10094},
year = {2021}
}
备注
12 pages, 6 figures, 3 Tables