中文

通过线性样本稀疏化实现主动回归

机器学习 2019-03-25 v3 数据结构与算法

摘要

我们提出一种方法,改善了多种曲线拟合问题的样本复杂度,包括线性回归、多项式回归的主动学习以及连续稀疏傅里叶变换。在主动线性回归问题中,给定整个无标签数据集 XRn×dX \in \mathbb{R}^{n \times d} 但仅观测少量标签 yiy_i,希望估计最小化 Xβy2\|X\beta - y\|_2 的最小二乘解 β\beta^*。我们证明 O(d)O(d) 个标签足以找到常数因子近似 β~\tilde{\beta}: E[Xβ~y22]2E[Xβy22]. \mathbb{E}[\|X\tilde{\beta} - y\|_2^2] \leq 2 \mathbb{E}[\|X \beta^* - y\|_2^2]. 这改进了杠杆得分采样的最佳先前结果 O(dlogd)O(d \log d)。我们还给出了\emph{归纳}情形的结果,说明 β~\tilde{\beta} 何时能泛化到新样本;这些适用于多项式回归等连续情形。最后,我们展示了该技术如何为非线性稀疏傅里叶变换情形带来改进结果。

关键词

引用

@article{arxiv.1711.10051,
  title  = {Active Regression via Linear-Sample Sparsification},
  author = {Xue Chen and Eric Price},
  journal= {arXiv preprint arXiv:1711.10051},
  year   = {2019}
}