关于错误有界在线学习中老虎机反馈代价的注记
离散数学
2021-02-02 v2 机器学习
组合数学
摘要
标准模型与老虎机模型是错误有界模型在在线多类分类中的两种推广。在两个模型中,学习器每轮猜测一个分类,但在标准模型中学习器在每次猜测后接收正确分类,而在老虎机模型中学习器每轮仅被告知其猜测是否正确。对任意多类分类器集合,定义和分别为标准模型和老虎机模型下的最优最坏情况预测错误数。Long (Theoretical Computer Science, 2020) 声称,对所有和无穷多个,存在一个从集合到大小为的集合的函数集合,使得且。该结果的证明依赖于如下引理,而该引理是错误的,例如对所有素数、(全向量)、(全向量)以及所有均不成立。引理:固定和素数,令从中均匀随机选取。对任意且,以及任意,有。我们表明,该引理恰在和模互为倍数时不成立。随后利用一个新引理,我们修正了Long的证明。
引用
@article{arxiv.2101.06891,
title = {A note on the price of bandit feedback for mistake-bounded online learning},
author = {Jesse Geneson},
journal= {arXiv preprint arXiv:2101.06891},
year = {2021}
}