中文

通过低秩字典追踪恢复相干数据

统计方法学 2014-07-17 v2 信息论 机器学习 math.IT 统计理论 统计理论

摘要

近期建立的鲁棒主成分分析(RPCA)方法为我们提供了一种从严重受损观测中恢复低秩矩阵的便捷途径。尽管 RPCA 在理论上优雅且在现实中强大,但它可能并非低秩矩阵恢复问题的终极解决方案。事实上,即使数据严格为低秩,其表现也可能不完美。这是因为传统的 RPCA 忽略了在现代应用中无处不在的数据聚类结构。随着聚类数量的增加,数据的相干性持续增强,从而导致 RPCA 的恢复性能下降。我们表明,只要适当配置低秩表示(LRR)中的字典,由相干数据(即具有高相干性的数据)引发的挑战便可得到缓解。更确切地说,我们从数学上证明了如果字典本身是低秩的,那么 LRR 将不受随底层聚类数量增加的相干参数的影响。这为处理相干数据提供了一个基本原则。随后,我们设计了一种实用算法,以在无监督环境中获得合适的字典。我们在随机生成矩阵上的大量实验验证了我们的主张。

关键词

引用

@article{arxiv.1404.4032,
  title  = {Recovery of Coherent Data via Low-Rank Dictionary Pursuit},
  author = {Guangcan Liu and Ping Li},
  journal= {arXiv preprint arXiv:1404.4032},
  year   = {2014}
}