通过低秩字典追踪恢复相干数据
统计方法学
2014-07-17 v2 信息论
机器学习
math.IT
统计理论
统计理论
摘要
近期建立的鲁棒主成分分析(RPCA)方法为我们提供了一种从严重受损观测中恢复低秩矩阵的便捷途径。尽管 RPCA 在理论上优雅且在现实中强大,但它可能并非低秩矩阵恢复问题的终极解决方案。事实上,即使数据严格为低秩,其表现也可能不完美。这是因为传统的 RPCA 忽略了在现代应用中无处不在的数据聚类结构。随着聚类数量的增加,数据的相干性持续增强,从而导致 RPCA 的恢复性能下降。我们表明,只要适当配置低秩表示(LRR)中的字典,由相干数据(即具有高相干性的数据)引发的挑战便可得到缓解。更确切地说,我们从数学上证明了如果字典本身是低秩的,那么 LRR 将不受随底层聚类数量增加的相干参数的影响。这为处理相干数据提供了一个基本原则。随后,我们设计了一种实用算法,以在无监督环境中获得合适的字典。我们在随机生成矩阵上的大量实验验证了我们的主张。
引用
@article{arxiv.1404.4032,
title = {Recovery of Coherent Data via Low-Rank Dictionary Pursuit},
author = {Guangcan Liu and Ping Li},
journal= {arXiv preprint arXiv:1404.4032},
year = {2014}
}