机器学习中的差异度、核集与草图
机器学习
2019-06-13 v1 数据结构与算法
机器学习
摘要
本文为函数族定义了类差异度(class discrepancy)的概念。它表明低差异度类允许存在小的离线与流式核集(coreset)。我们提供了用于界定机器学习问题类差异度的一般技术。作为该一般技术的推论,我们界定了逻辑回归、sigmoid激活损失、矩阵协方差、核密度以及点积或平方距离的任意解析函数的差异度(从而界定了核集复杂度)。我们的结果证明了上述问题存在大小为 epsilon-近似 O(sqrt{d}/epsilon) 的核集。这解决了关于高斯核密度估计核集复杂度的长期开放问题。我们提供了两个相关但独立的结果。首先,对广泛使用的合并-归约(merge-and-reduce)技巧的指数级改进,为任何低差异度问题给出了改进的流式草图。其次,一种极其简单的确定性算法,用于为任何正半定核寻找低差异度序列(从而核集)。本文建立了类差异度、核集复杂度、可学习性与流式算法之间的一些明确联系。
引用
@article{arxiv.1906.04845,
title = {Discrepancy, Coresets, and Sketches in Machine Learning},
author = {Zohar Karnin and Edo Liberty},
journal= {arXiv preprint arXiv:1906.04845},
year = {2019}
}