中文

非参数在线学习的快速收敛率:从可实现性到博弈学习

机器学习 2022-04-13 v2 数据结构与算法 计算机科学与博弈论 机器学习

摘要

我们研究非参数在线回归设定下的快速收敛率,即遗憾相对于具有有界复杂度的任意函数类定义。我们的贡献有两点:- 在采用绝对损失的不可知(realizable)非参数在线回归设定中,我们提出一种随机化恰当学习算法,其累积损失关于假设类的序列 fat-shattering 维数近最优。在 Littlestone 维数为 dd 的在线分类设定中,我们的界降为 dpolylogTd \cdot {\rm poly} \log T。该结果回答了恰当学习器能否达到近最优累积损失的问题;此前,即便对于在线分类,已知最佳累积损失为 O~(dT)\tilde O( \sqrt{dT})。进一步,对于实值(回归)设定,关于序列 fat-shattering 维数具有近最优缩放的累积损失界,即便对于非恰当学习器,此前也未知。- 利用上述结果,我们给出一种针对 Littlestone 维数为 dd 的一般和二元博弈的独立学习算法,其中每个玩家实现遗憾 O~(d3/4T1/4)\tilde O(d^{3/4} \cdot T^{1/4})。该结果推广了 Syrgkanis 等人(2015)的类似结论,他们表明在有限博弈中,最优遗憾可从对抗设定下的 O(T)O(\sqrt{T}) 加速至博弈设定下的 O(T1/4)O(T^{1/4})。为建立上述结果,我们引入了若干新技术,包括:用于实值类达到最优累积损失的分层聚合规则、Hanneke 等人(2021)恰当在线可实现学习器的多尺度扩展、证明此类非参数学习算法输出稳定的方法,以及证明极小极大定理在所有在线可学习博弈中成立的证明。

关键词

引用

@article{arxiv.2111.08911,
  title  = {Fast Rates for Nonparametric Online Learning: From Realizability to Learning in Games},
  author = {Constantinos Daskalakis and Noah Golowich},
  journal= {arXiv preprint arXiv:2111.08911},
  year   = {2022}
}

备注

61 pages