中文

通过正则化体积采样进行岭回归的子采样

机器学习 2018-02-26 v2

摘要

给定 nn 个向量 xiRd\mathbf{x}_i\in \mathbb{R}^d,我们希望为带噪标签 yiRy_i\in\mathbb{R} 拟合一个线性回归模型。岭估计器是解决该问题的经典方法。然而,当标签获取成本高昂时,我们被迫仅选择一小部分向量 xi\mathbf{x}_i 来获取标签 yiy_i。我们提出了一种新的向量子集选择过程,使得从该子集获得的岭估计器在全量 nn 个带标签向量数据集的均方预测误差方面提供强有力的统计保证。所需标签数量与问题的统计维度成正比,而该维度通常远小于 dd。我们的方法是称为体积采样的联合子采样过程的扩展。第二大贡献是,我们加速了体积采样,使其效率基本上与杠杆分数相当,后者是此任务的主要独立同分布子采样过程。最后,我们从理论与实验上证明,当标签获取成本高昂时,体积采样相比任何独立同分布采样均具有明显优势。

关键词

引用

@article{arxiv.1710.05110,
  title  = {Subsampling for Ridge Regression via Regularized Volume Sampling},
  author = {Michał Dereziński and Manfred K. Warmuth},
  journal= {arXiv preprint arXiv:1710.05110},
  year   = {2018}
}