无线切换优化中的并行上下文老虎机
网络与互联网体系结构
2019-02-07 v1 机器学习
机器学习
摘要
随着蜂窝网络变得日益密集,对无线基站参数的可扩展且动态的调优只能通过自动化优化来实现。尽管上下文老虎机框架作为此类任务的自然候选而出现,但其向并行设置的扩展并非直截了当:需要仔细调整现有方法以充分利用该问题的多智能体结构。我们提出两种方法:一种派生自确定性的类 UCB 方法,另一种依赖于 Thompson 采样。得益于其贝叶斯性质,后者被直觉地认为能更好地保持老虎机批量中的探索-利用平衡。这一点在玩具实验上得到验证,其中 Thompson 采样对上下文的变异性表现出鲁棒性。最后,我们将两种方法应用于真实的基站网络数据集,并证明 Thompson 采样优于人工调优和上下文 UCB。
引用
@article{arxiv.1902.01931,
title = {Parallel Contextual Bandits in Wireless Handover Optimization},
author = {Igor Colin and Albert Thomas and Moez Draief},
journal= {arXiv preprint arXiv:1902.01931},
year = {2019}
}