中文

关于错误有界在线学习中老虎机反馈代价的注记

离散数学 2021-02-02 v2 机器学习 组合数学

摘要

标准模型与老虎机模型是错误有界模型在在线多类分类中的两种推广。在两个模型中,学习器每轮猜测一个分类,但在标准模型中学习器在每次猜测后接收正确分类,而在老虎机模型中学习器每轮仅被告知其猜测是否正确。对任意多类分类器集合FF,定义optstd(F)opt_{std}(F)optbandit(F)opt_{bandit}(F)分别为标准模型和老虎机模型下的最优最坏情况预测错误数。Long (Theoretical Computer Science, 2020) 声称,对所有M>2M > 2和无穷多个kk,存在一个从集合XX到大小为kk的集合YY的函数集合FF,使得optstd(F)=Mopt_{std}(F) = Moptbandit(F)(1o(1))(YlnY)optstd(F)opt_{bandit}(F) \ge (1 - o(1))(|Y|\ln{|Y|})opt_{std}(F)。该结果的证明依赖于如下引理,而该引理是错误的,例如对所有素数p5p \ge 5s=1s = \mathbf{1}(全11向量)、t=2t = \mathbf{2}(全22向量)以及所有zz均不成立。引理:固定n2n \ge 2和素数pp,令uu{0,,p1}n\left\{0, \dots, p-1\right\}^n中均匀随机选取。对任意s,t{1,,p1}ns, t \in \left\{1, \dots, p-1\right\}^nsts \neq t,以及任意z{0,,p1}z \in \left\{0, \dots, p-1\right\},有Pr(tu=zmodp  su=zmodp)=1p\Pr(t \cdot u = z \mod p \text{ } | \text{ } s \cdot u = z \mod p) = \frac{1}{p}。我们表明,该引理恰在ssttpp互为倍数时不成立。随后利用一个新引理,我们修正了Long的证明。

关键词

引用

@article{arxiv.2101.06891,
  title  = {A note on the price of bandit feedback for mistake-bounded online learning},
  author = {Jesse Geneson},
  journal= {arXiv preprint arXiv:2101.06891},
  year   = {2021}
}