中文

近线性稀疏度 regime 下的字典学习

机器学习 2023-03-29 v2 信号处理 概率论 机器学习

摘要

字典学习,即从形如 yi=Dxi\mathbf{y}_i = \mathbf{D}\mathbf{x}_i 的样本中恢复稀疏使用的矩阵 DRM×K\mathbf{D} \in \mathbb{R}^{M \times K}NNss-稀疏向量 xiRK\mathbf{x}_i \in \mathbb{R}^{K} 的问题,在信号处理与数据科学中的应用日益重要。当字典已知时,即便稀疏度与维度 MM 呈线性关系也能恢复 xi\mathbf{x}_i;然而迄今为止,唯一在线性稀疏度 regime 下可证明成功的算法是黎曼信赖域方法(仅限于正交字典)和基于平方和层次的方法(需要超多项式时间以获得随 MM 衰减的误差)。本工作中,我们引入 SPORADIC(SPectral ORAcle DICtionary Learning),一种在重加权协方差矩阵族上的高效谱方法。我们证明,在足够高维度下,即便稀疏度在至多对数因子内与维度呈线性,SPORADIC 也能恢复满足著名限制等距性质(RIP)的过完备(K>MK > M)字典。此外,这些精度保证具有“预言性质”:未知稀疏向量 xi\mathbf{x}_i 的支撑与符号可以高概率被精确恢复,从而在多项式时间内以足够样本对任意接近地估计 D\mathbf{D}。据作者所知,SPORADIC 是首个在近线性稀疏度 regime 下对过完备 RIP 矩阵可证明享有此类收敛保证的多项式时间算法。

关键词

引用

@article{arxiv.2210.10855,
  title  = {Dictionary Learning for the Almost-Linear Sparsity Regime},
  author = {Alexei Novikov and Stephen White},
  journal= {arXiv preprint arXiv:2210.10855},
  year   = {2023}
}