中文

在线多类分类中超越赌博机反馈

机器学习 2024-02-20 v1

摘要

我们研究在线多类分类问题,其中学习者的反馈由任意有向图决定。反馈图虽将赌博机反馈作为特例包含在内,但允许更丰富的应用集合,包括过滤和标签高效分类。我们引入了 Gappletron,这是首个适用于任意反馈图的在线多类算法。对于这一新算法,我们证明了代理遗憾界,该界对一大类代理损失在期望意义下和具有高概率意义下均成立。我们的界量级为 BρKTB\sqrt{\rho KT},其中 BB 是预测空间的直径,KK 是类别数,TT 是时间范围,ρ\rho 是支配数(一个影响探索量的图论参数)。在完全信息情形下,我们表明 Gappletron 实现了量级为 B2KB^2K 的常数代理遗憾。我们还证明了一个量级为 max{B2K,T}\max\{B^2K,\sqrt{T}\} 的一般下界,表明我们的上界无法被显著改进。在合成数据上的实验表明,对于各种反馈图,我们的算法与已知基线相比具有竞争力。

关键词

引用

@article{arxiv.2106.03596,
  title  = {Beyond Bandit Feedback in Online Multiclass Classification},
  author = {Dirk van der Hoeven and Federico Fusco and Nicolò Cesa-Bianchi},
  journal= {arXiv preprint arXiv:2106.03596},
  year   = {2024}
}