中文

使用查询的不可知学习多指标模型

机器学习 2023-12-29 v1 数据结构与算法 统计理论 机器学习 统计理论

摘要

我们研究了在高斯分布下不可知学习任务中查询访问的能力。在不可知模型中,不对标签做任何假设,目标是计算一个与已知类中最佳拟合函数竞争的假设,即实现误差 opt+ϵ\mathrm{opt}+\epsilon,其中 opt\mathrm{opt} 是类中最佳函数的误差。我们关注一个通用的多指标模型(MIMs)族,它们是仅依赖于少数相关方向的 dd 元函数,即对于未知链接函数 ggk×dk \times d 矩阵 W\mathbf{W},具有形式 g(Wx)g(\mathbf{W} \mathbf{x})。多指标模型涵盖了广泛常见研究的函数类,包括具有ReLU激活函数的常数深度神经网络以及半空间的交集。我们的主要结果表明,对于不可知学习MIMs,查询访问在运行时间上比随机样本有显著改进。在链接函数的标准正则性假设(即有界变差或表面积)下,我们给出了一个复杂度为 O(k)poly(1/ϵ)  poly(d)O(k)^{\mathrm{poly}(1/\epsilon)} \; \mathrm{poly}(d) 的不可知查询学习器。相比之下,仅依赖随机样本的算法固有地需要 dpoly(1/ϵ)d^{\mathrm{poly}(1/\epsilon)} 个样本和运行时间,即使对于不可知学习单个ReLU或半空间的基本问题也是如此。我们的算法结果建立了在高斯分布下不可知PAC模型和不可知PAC+查询模型之间的强计算分离。在我们工作之前,这种分离是未知的——即使对于不可知学习单个半空间的特殊情况,这也是Feldman首先提出的一个开放问题。我们的结果通过一种通用的降维技术实现,该技术利用查询访问来估计底层标签函数(平滑版本)的梯度。

关键词

引用

@article{arxiv.2312.16616,
  title  = {Agnostically Learning Multi-index Models with Queries},
  author = {Ilias Diakonikolas and Daniel M. Kane and Vasilis Kontonis and Christos Tzamos and Nikos Zarifis},
  journal= {arXiv preprint arXiv:2312.16616},
  year   = {2023}
}

备注

abstract shortened due to arxiv requirements