中文

对ER-SpUD字典学习算法的改进分析

机器学习 2016-02-19 v1 数据结构与算法 信息论 math.IT 概率论

摘要

在“字典学习”中,我们观测 Y=AX+EY = AX + E,其中 YRn×pY\in\mathbb{R}^{n\times p}, ARm×nA \in\mathbb{R}^{m\times n}, XRm×pX\in\mathbb{R}^{m\times p}。矩阵 YY 被观测到,而 A,X,EA, X, E 未知。这里 EE 是小范数“噪声”,XX 是列稀疏的。矩阵 AA 被称为字典,其列被称为原子。然后,给定少量样本数 pp(即 YY 的列),目标是学习字典 AA 至小误差,以及 XX。其动机在于许多应用中,数据在“正确”字典 AA 的原子表示下是稀疏的(例如Haar小波基下的图像),目标是从数据中学习 AA 以用于其他应用。最近,[SWW12]提出了字典学习算法ER-SpUD,在 E=0E = 0m=nm = n 时具有可证明的保证。他们表明,若 XX 具有独立项,每列期望 ss 个非零元,且 1sn1 \lesssim s \lesssim \sqrt{n},非零项服从亚高斯分布,则对于 pn2log2np\gtrsim n^2\log^2 n,以高概率ER-SpUD输出矩阵 A,XA', X',其等于 A,XA, X 直至对 AA(相应 XX)的列(相应行)进行置换和缩放。他们猜想 pnlognp\gtrsim n\log n 已足够,并证明当 s1s \simeq 1 时这在信息论上任何算法成功都是必要的。后续[LV15]取得了显著进展。我们证明,对于ER-SpUD的一个微小变体,pnlog(n/δ)p\gtrsim n\log(n/\delta) 个样本足以以 1δ1-\delta 概率成功恢复。我们还证明,对于未修改的ER-SpUD,即使以多项式小成功概率学习 A,XA, X 也需要 pn1.99p\gtrsim n^{1.99} 个样本。这解决了[SWW12]的主要猜想,并与[LV15]的主要结果相矛盾,后者声称 pnlog4np\gtrsim n\log^4 n 能保证以高概率成功。

关键词

引用

@article{arxiv.1602.05719,
  title  = {An improved analysis of the ER-SpUD dictionary learning algorithm},
  author = {Jarosław Błasiok and Jelani Nelson},
  journal= {arXiv preprint arXiv:1602.05719},
  year   = {2016}
}