中文

基于图核MAB的在线网络源优化

机器学习 2023-07-10 v1 机器学习

摘要

我们提出Grab-UCB,一种图核多臂_bandit(multi-arms bandit)算法,用于在线学习大规模网络中的最优源放置,以最大化从先验未知网络过程获得的奖励。不确定性要求在线学习,但其受维数灾难困扰。为实现样本效率,我们用自适应图字典模型描述网络过程,其通常导致稀疏谱表示。这促成了数据高效的学习框架,其学习率随谱表示模型的维度而非网络维度缩放。随后我们提出Grab-UCB,一种在线序贯决策策略,在优化动作策略的同时学习谱表示的参数。我们推导出依赖于网络参数的性能保证,其进一步影响序贯决策策略的学习曲线。我们引入一种计算简化的求解方法Grab-arm-Light,一种沿表示目标函数的多面体边行走的算法。仿真结果表明,所提在线学习算法优于通常将学习阶段与测试阶段分离的基线离线方法。结果证实了理论发现,并进一步凸显了所提在线学习策略在累积后悔、样本效率和计算复杂度方面的增益。

关键词

引用

@article{arxiv.2307.03641,
  title  = {Online Network Source Optimization with Graph-Kernel MAB},
  author = {Laura Toni and Pascal Frossard},
  journal= {arXiv preprint arXiv:2307.03641},
  year   = {2023}
}