Learning-NUM:具有未知效用函数与排队时延的网络效用最大化
网络与互联网体系结构
2020-12-18 v1 机器学习
摘要
网络效用最大化(NUM)研究在网络资源约束下为网络用户分配流量速率以最大化用户总效用的问题。本文提出一种新的NUM框架Learning-NUM,其中用户的效用函数先验未知,且只有在相应流量送达目的地后才能观测到该流量速率的效用函数值,这意味着效用反馈经历排队时延。目标是设计一种策略,逐步学习效用函数并做出速率分配与网络调度/路由决策,以最大化有限时间范围内获得的总效用。除未知效用函数与随机约束外,本问题的核心挑战在于观测的排队时延,其可能无界且依赖于策略的决策。我们首先证明最佳动态策略获得的期望总效用由一静态优化问题的解上界限定。在无反馈时延情形下,我们基于梯度估计与Max-Weight调度的思想设计了一种算法。为处理反馈时延,我们将该算法嵌入并行实例范式以形成策略,实现后悔值,即最佳动态策略与我们所提策略的期望效用之差为。最后,为展示Learning-NUM框架的实际适用性,我们将其应用于数据库查询、作业调度与视频流三种场景。我们进一步在作业调度应用上开展仿真以评估策略的经验性能。
引用
@article{arxiv.2012.09222,
title = {Learning-NUM: Network Utility Maximization with Unknown Utility Functions and Queueing Delay},
author = {Xinzhe Fu and Eytan Modiano},
journal= {arXiv preprint arXiv:2012.09222},
year = {2020}
}