具有非齐次马尔可夫奖励的组合网络优化的在线学习
机器学习
2011-09-09 v1 网络与互联网体系结构
最优化与控制
概率论
摘要
考虑边权重以计算最优结构的组合网络优化算法构成了许多网络协议的基础。示例包括最短路径路由、最小生成树计算、二部图上的最大权匹配等。我们提出了 CLRMR,这是首个能够高效解决这些问题随机版本的在线学习算法,其中底层边权重作为具有未知动态的独立马尔可夫链而变化。在线学习算法的性能由遗憾来表征,其定义为适当定义的先知所获得的奖励与给定算法所获得的奖励之间的累积差值。我们证明,与一个已知马尔可夫转移矩阵且始终使用单一最优结构的先知相比,CLRMR 产生的遗憾关于边数是多项式级的,且关于时间是对数近似的。
引用
@article{arxiv.1109.1606,
title = {Online Learning for Combinatorial Network Optimization with Restless Markovian Rewards},
author = {Yi Gai and Bhaskar Krishnamachari and Mingyan Liu},
journal= {arXiv preprint arXiv:1109.1606},
year = {2011}
}