反馈图在线学习的一种近最优兼优算法
机器学习
2022-06-02 v1
摘要
我们考虑带反馈图的在线学习,这是一种序列决策框架,其中学习者的反馈由动作集上的有向图决定。我们提出了一种在该框架下计算高效的算法,它同时在随机和对抗环境下达到近最优后悔界。针对遗忘对手的界为 ,其中 为时间范围, 为反馈图的独立数。针对随机环境的界为 ,其中 为图的适当定义的无向版本中所有独立集的族, 为次优间隙。该算法结合了用于随机与对抗赌博机的 EXP3++ 算法、用于反馈图的 EXP3.G 算法以及一种新颖探索方案的思想。该方案利用图的结构来减少探索,是获得带反馈图兼优保证的关键。我们还将算法和结果推广到反馈图可随时间变化的情形。
引用
@article{arxiv.2206.00557,
title = {A Near-Optimal Best-of-Both-Worlds Algorithm for Online Learning with Feedback Graphs},
author = {Chloé Rouyer and Dirk van der Hoeven and Nicolò Cesa-Bianchi and Yevgeny Seldin},
journal= {arXiv preprint arXiv:2206.00557},
year = {2022}
}