中文

通过熵惩罚在凸包中的稀疏恢复

统计理论 2009-05-14 v1 统计理论

摘要

(X,Y)(X,Y)S×TS\times T上具有未知分布PP的随机对,(X1,Y1),...,(Xn,Yn)(X_1,Y_1),...,(X_n,Y_n)(X,Y)(X,Y)的独立同分布副本。记PnP_n(X1,Y1),...,(Xn,Yn)(X_1,Y_1),...,(X_n,Y_n)的经验分布。设h1,...,hN:S[1,1]h_1,...,h_N:S\mapsto [-1,1]是由NN个函数组成的字典。对于λRN\lambda \in {\mathbb{R}}^N,记fλ:=j=1Nλjhjf_{\lambda}:=\sum_{j=1}^N\lambda_jh_j。设:T×RR\ell:T\times {\mathbb{R}}\mapsto {\mathbb{R}}为给定的损失函数,并假设其对第二个变量是凸的。令(f)(x,y):=(y;f(x))(\ell \bullet f)(x,y):=\ell(y;f(x))。最后,设ΛRN\Lambda \subset {\mathbb{R}}^N{1,...,N}\{1,...,N\}上所有概率分布的单纯形。考虑以下惩罚经验风险最小化问题:\begin{eqnarray*}\hat{\lambda}^{\varepsilon}:={\mathop {argmin}_{\lambda\in \Lambda}}\Biggl[P_n(\ell \bullet f_{\lambda})+\varepsilon \sum_{j=1}^N\lambda_j\log \lambda_j\Biggr]\end{eqnarray*}及其分布依赖版本:\begin{eqnarray*}\lambda^{\varepsilon}:={\mathop {argmin}_{\lambda\in \Lambda}}\Biggl[P(\ell \bullet f_{\lambda})+\varepsilon \sum_{j=1}^N\lambda_j\log \lambda_j\Biggr],\end{eqnarray*}其中ε0\varepsilon\geq 0是正则化参数。证明了λε\lambda^{\varepsilon}的“近似稀疏性”蕴含λ^ε\hat{\lambda}^{\varepsilon}的“近似稀疏性”,并探讨了“稀疏性”对经验解超额风险界限的影响。在熵惩罚密度估计的情形下也讨论了类似结果。

关键词

引用

@article{arxiv.0905.2078,
  title  = {Sparse recovery in convex hulls via entropy penalization},
  author = {Vladimir Koltchinskii},
  journal= {arXiv preprint arXiv:0905.2078},
  year   = {2009}
}

备注

Published in at http://dx.doi.org/10.1214/08-AOS621 the Annals of Statistics (http://www.imstat.org/aos/) by the Institute of Mathematical Statistics (http://www.imstat.org)