中文

反馈图在线学习的一种近最优兼优算法

机器学习 2022-06-02 v1

摘要

我们考虑带反馈图的在线学习,这是一种序列决策框架,其中学习者的反馈由动作集上的有向图决定。我们提出了一种在该框架下计算高效的算法,它同时在随机和对抗环境下达到近最优后悔界。针对遗忘对手的界为 O~(αT)\tilde{O} (\sqrt{\alpha T}),其中 TT 为时间范围,α\alpha 为反馈图的独立数。针对随机环境的界为 O((lnT)2maxSI(G)iSΔi1)O\big( (\ln T)^2 \max_{S\in \mathcal I(G)} \sum_{i \in S} \Delta_i^{-1}\big),其中 I(G)\mathcal I(G) 为图的适当定义的无向版本中所有独立集的族,Δi\Delta_i 为次优间隙。该算法结合了用于随机与对抗赌博机的 EXP3++ 算法、用于反馈图的 EXP3.G 算法以及一种新颖探索方案的思想。该方案利用图的结构来减少探索,是获得带反馈图兼优保证的关键。我们还将算法和结果推广到反馈图可随时间变化的情形。

关键词

引用

@article{arxiv.2206.00557,
  title  = {A Near-Optimal Best-of-Both-Worlds Algorithm for Online Learning with Feedback Graphs},
  author = {Chloé Rouyer and Dirk van der Hoeven and Nicolò Cesa-Bianchi and Yevgeny Seldin},
  journal= {arXiv preprint arXiv:2206.00557},
  year   = {2022}
}