中文

完备字典学习的可辨识性

机器学习 2019-09-20 v2 机器学习

摘要

稀疏分量分析(SCA),也称为完备字典学习,是如下问题:给定输入矩阵 MM 与整数 rr,寻找具有 rr 列的字典 DD 与具有 kk-稀疏列(即 BB 的每一列至多具有 kk 个非零项)的矩阵 BB,使得 MDBM \approx DB。SCA 中的一个关键问题为可辨识性,即刻画 DDBB 本质上唯一(即除 DD 的列与 BB 的行的置换与缩放外唯一)的条件。尽管在过去二十年中 SCA 已被广泛研究,仅有少数工作在确定性场景下处理该问题,且尚无工作给出导致可辨识性的最小样本数(即 MM 的列数)的合理界。本文中,我们在数据具有低秩结构(即 DD 为(欠)完备)的确定性场景下给出新结果。先前界含有组合项 (rk)r \choose k,我们给出涉及 O(r3/(rk)2)\mathcal{O}(r^3/(r-k)^2) 样本的充分条件,只要这些数据点在 DDr1r-1 列所张成的子空间间分布良好,即可产生本质唯一的分解。我们还给出了样本数的必要下界,其在 kk 等于 r1r-1 时与文献中先前结果矛盾。相比当前最优,我们的界有显著改进,并意味着例如对于固定的零比例(恒定且与 rr 无关,如 BB 中 10% 零项),仅需 O(r)\mathcal{O}(r) 个数据点即可保证可辨识性。

关键词

引用

@article{arxiv.1808.08765,
  title  = {Identifiability of Complete Dictionary Learning},
  author = {Jérémy E. Cohen and Nicolas Gillis},
  journal= {arXiv preprint arXiv:1808.08765},
  year   = {2019}
}

备注

19 pages, 2 figures, new title, added references and discussions