随机在线最短路径路由:反馈的价值
网络与互联网体系结构
2017-01-19 v5 机器学习
最优化与控制
摘要
本文研究了多跳网络上的在线最短路径路由问题。链路成本或延迟是时变的,并由独立同分布的随机过程建模,其参数初始未知。这些参数(进而最优路径)只能通过通过网络路由数据包并观察实际实现的延迟来进行估计。我们的目标是找到一种路由策略,以最小化该策略所选路径与未知最优路径之间的遗憾(expected delay 的累积差异)。我们将该问题表述为组合多臂老虎机(combinatorial bandit)优化问题,并考虑了多种场景,这些场景在路由决策的制定位置以及决策时可用的信息方面有所不同。对于每种场景,我们推导出了任何在线路由策略都必须满足的紧密渐近遗憾下界。这些界限有助于我们理解在以下情况下预期的性能提升:(i) 在每一跳而非仅在源节点制定路由决策;(ii) 观测每链路的延迟而非端到端的路径延迟。特别是,我们表明 (i) 并无用处,而 (ii) 可能产生显著影响。我们提出了三种算法,它们在计算复杂度和性能之间进行了权衡。这些算法的遗憾上界优于现有算法,并且在数值实验中显著优于最先进(state-of-the-art)的算法。
引用
@article{arxiv.1309.7367,
title = {Stochastic Online Shortest Path Routing: The Value of Feedback},
author = {M. Sadegh Talebi and Zhenhua Zou and Richard Combes and Alexandre Proutiere and Mikael Johansson},
journal= {arXiv preprint arXiv:1309.7367},
year = {2017}
}
备注
18 pages