中文

Delaytron:利用延迟赌博机反馈高效学习多类分类器

机器学习 2022-05-18 v1 人工智能 机器学习

摘要

本文提出了一种名为 Delaytron 的在线算法,用于利用延迟的赌博机反馈学习多类分类器。反馈延迟序列 {dt}t=1T\{d_t\}_{t=1}^T 对算法是未知的。在第 tt 轮,算法观察一个样本 xt\mathbf{x}_t,预测一个标签 y~t\tilde{y}_t,并仅在 dtd_t 轮之后收到赌博机反馈 I[y~t=yt]\mathbb{I}[\tilde{y}_t=y_t]。当 t+dt>Tt+d_t>T 时,我们认为第 tt 轮的反馈丢失。我们证明,当每个丢失样本的损失上界为 LL 时,所提算法实现的遗憾界为 O(2Kγ[T2+(2+L2R2\WF2)t=1Tdt])\mathcal{O}\left(\sqrt{\frac{2 K}{\gamma}\left[\frac{T}{2}+\left(2+\frac{L^2}{R^2\Vert \W\Vert_F^2}\right)\sum_{t=1}^Td_t\right]}\right)。在丢失样本的损失无上界的情况下,Delaytron 实现的遗憾界为 O(2Kγ[T2+2t=1Tdt+MT])\mathcal{O}\left(\sqrt{\frac{2 K}{\gamma}\left[\frac{T}{2}+2\sum_{t=1}^Td_t+\vert \mathcal{M}\vert T\right]}\right),其中 M\mathcal{M}TT 轮中丢失样本的集合。这些界是通过一个需要已知 TTt=1Tdt\sum_{t=1}^Td_t 的恒定步长实现的。对于 TTt=1Tdt\sum_{t=1}^Td_t 未知的情况,我们使用在线学习的倍增技巧,并提出了自适应 Delaytron。我们证明自适应 Delaytron 实现的遗憾界为 O(T+t=1Tdt)\mathcal{O}\left(\sqrt{T+\sum_{t=1}^Td_t}\right)。我们通过在多个数据集上进行实验并与最先进的方法进行比较,展示了我们方法的有效性。

关键词

引用

@article{arxiv.2205.08234,
  title  = {Delaytron: Efficient Learning of Multiclass Classifiers with Delayed Bandit Feedbacks},
  author = {Naresh Manwani and Mudit Agarwal},
  journal= {arXiv preprint arXiv:2205.08234},
  year   = {2022}
}