中文

面向高维不可微学习问题的近似留一法

机器学习 2018-10-08 v1 机器学习

摘要

考虑如下一类学习方案:\begin{equation} \label{eq:main-problem1} \hat{\boldsymbol{\beta}} := \underset{\boldsymbol{\beta} \in \mathcal{C}}{\arg\min} \;\sum_{j=1}^n \ell(\boldsymbol{x}_j^\top\boldsymbol{\beta}; y_j) + \lambda R(\boldsymbol{\beta}), \qquad \qquad \qquad (1) \end{equation} 其中 xiRp\boldsymbol{x}_i \in \mathbb{R}^pyiRy_i \in \mathbb{R} 分别表示第 ii 个特征与响应变量。令 \ellRR 为凸损失函数与正则化项,β\boldsymbol{\beta} 表示未知权重,λ\lambda 为正则化参数。CRp\mathcal{C} \subset \mathbb{R}^{p} 为闭凸集。在 nnpp 均很大的高维情形下,寻找 λ\lambda 的最优选择是一个具有挑战性的问题。我们提出了三种框架,以对不可微损失和正则化项的留一交叉验证(LOOCV)风险获得计算高效的近似。我们的三种框架基于(1)的原问题、对偶问题和近端形式。每种框架在特定类型问题中展现出其优势。我们在光滑性条件下证明了三种方法的等价性。该等价性使我们能够在此类条件下论证三种方法的准确性。我们利用所提方法对若干标准问题(包括广义 LASSO、核范数正则化和支持向量机)获得风险估计。我们实证展示了我们的结果在不可微情形下的有效性。

关键词

引用

@article{arxiv.1810.02716,
  title  = {Approximate Leave-One-Out for High-Dimensional Non-Differentiable Learning Problems},
  author = {Shuaiwen Wang and Wenda Zhou and Arian Maleki and Haihao Lu and Vahab Mirrokni},
  journal= {arXiv preprint arXiv:1810.02716},
  year   = {2018}
}

备注

63 pages, 7 figures. arXiv admin note: substantial text overlap with arXiv:1807.02694