中文

具有反馈图与切换成本的在线学习

机器学习 2019-05-21 v2 机器学习

摘要

我们研究在线学习问题,其中在学习过程的每次动作之后提供部分反馈信息,且学习器因改变动作而产生切换成本。在此设定下,反馈信息系统可用图表示,先前的工作研究了团(专家设定)或互不相连的单环(多臂老虎机(MAB))情形中学习器的期望后悔。本工作给出了部分信息(PI)设定下、即针对一般反馈图(不包括团)的期望后悔下界。此外,它表明所有在无切换成本时最优的算法在存在切换成本时必然次优,这促使我们需要设计新算法。我们提出两种新算法:基于阈值的EXP3与EXP3.SC。对于对称PI设定与MAB这两个特例,这两种算法的期望后悔在学习过程时长上均为阶最优。此外,基于阈值的EXP3在切换成本上阶最优,而EXP3.SC则不是。最后,实证评估表明,在存在切换成本时,基于阈值的EXP3优于先前提出的阶最优算法EXP3 SET,且在带切换成本的MAB设定中优于Batch EXP3。

关键词

引用

@article{arxiv.1810.09666,
  title  = {Online learning with feedback graphs and switching costs},
  author = {Anshuka Rangi and Massimo Franceschetti},
  journal= {arXiv preprint arXiv:1810.09666},
  year   = {2019}
}

备注

Published in Proceedings of the 22nd International Conference on Artificial Intelligence and Statistics (AISTATS) 2019. PMLR: Volume 89