未知效用下的随机网络效用最大化:多臂老虎机方法
机器学习
2020-06-18 v1 网络与互联网体系结构
机器学习
摘要
本文研究一类新颖的随机网络效用最大化(NUM)问题,其中智能体的效用未知。每个智能体的效用取决于其从网络运营商/控制器处获得的资源量。运营商希望进行一种资源分配,以最大化网络的期望总效用。我们考虑阈值型效用函数,其中若智能体获得的资源量高于某一阈值,则其获得非零效用;否则其效用为零(硬实时)。我们将这一效用未知的 NUM 设定建模为遗憾最小化问题。我们的目标是确定一种策略,其表现与知晓智能体效用的预言机策略同样“好”。我们将该问题设定建模为老虎机设定,其中每轮获得的反馈取决于分配给智能体的资源。我们利用多播放多臂老虎机与组合半老虎机的思想,针对这一新颖设定提出算法。我们证明当所有智能体具有相同效用时,所提算法是最优的。我们通过数值实验验证了所提算法的性能保证。
引用
@article{arxiv.2006.09997,
title = {Stochastic Network Utility Maximization with Unknown Utilities: Multi-Armed Bandits Approach},
author = {Arun Verma and Manjesh K. Hanawal},
journal= {arXiv preprint arXiv:2006.09997},
year = {2020}
}
备注
Accepted to INFOCOM 2020