中文

未知效用下的随机网络效用最大化:多臂老虎机方法

机器学习 2020-06-18 v1 网络与互联网体系结构 机器学习

摘要

本文研究一类新颖的随机网络效用最大化(NUM)问题,其中智能体的效用未知。每个智能体的效用取决于其从网络运营商/控制器处获得的资源量。运营商希望进行一种资源分配,以最大化网络的期望总效用。我们考虑阈值型效用函数,其中若智能体获得的资源量高于某一阈值,则其获得非零效用;否则其效用为零(硬实时)。我们将这一效用未知的 NUM 设定建模为遗憾最小化问题。我们的目标是确定一种策略,其表现与知晓智能体效用的预言机策略同样“好”。我们将该问题设定建模为老虎机设定,其中每轮获得的反馈取决于分配给智能体的资源。我们利用多播放多臂老虎机与组合半老虎机的思想,针对这一新颖设定提出算法。我们证明当所有智能体具有相同效用时,所提算法是最优的。我们通过数值实验验证了所提算法的性能保证。

关键词

引用

@article{arxiv.2006.09997,
  title  = {Stochastic Network Utility Maximization with Unknown Utilities: Multi-Armed Bandits Approach},
  author = {Arun Verma and Manjesh K. Hanawal},
  journal= {arXiv preprint arXiv:2006.09997},
  year   = {2020}
}

备注

Accepted to INFOCOM 2020