Delaytron:利用延迟赌博机反馈高效学习多类分类器
机器学习
2022-05-18 v1 人工智能
机器学习
摘要
本文提出了一种名为 Delaytron 的在线算法,用于利用延迟的赌博机反馈学习多类分类器。反馈延迟序列 对算法是未知的。在第 轮,算法观察一个样本 ,预测一个标签 ,并仅在 轮之后收到赌博机反馈 。当 时,我们认为第 轮的反馈丢失。我们证明,当每个丢失样本的损失上界为 时,所提算法实现的遗憾界为 。在丢失样本的损失无上界的情况下,Delaytron 实现的遗憾界为 ,其中 是 轮中丢失样本的集合。这些界是通过一个需要已知 和 的恒定步长实现的。对于 和 未知的情况,我们使用在线学习的倍增技巧,并提出了自适应 Delaytron。我们证明自适应 Delaytron 实现的遗憾界为 。我们通过在多个数据集上进行实验并与最先进的方法进行比较,展示了我们方法的有效性。
引用
@article{arxiv.2205.08234,
title = {Delaytron: Efficient Learning of Multiclass Classifiers with Delayed Bandit Feedbacks},
author = {Naresh Manwani and Mudit Agarwal},
journal= {arXiv preprint arXiv:2205.08234},
year = {2022}
}