基于核分数的列和行子集选择:针对 Nystr"{o}m 近似、CUR 分解和图 Laplacian 降低的算法与理论
数值分析
2024-08-09 v2 数值分析
机器学习
摘要
列选择是结构保持低秩近似的 essential tool,广泛应用于数据科学、机器学习和理论化学等诸多领域。本文发展了统一的方法,用于快速、高效且在理论上得到保证的列选择。首先,我们推导并实现了一种可利用稀疏性的确定性算法,可用于包括核近似和 CUR 分解在内的各种任务。接下来,我们发展了一种依赖随机化方案的矩阵无格式化方法,满足保证浓度界,同时用于 CUR 分解和图 Laplacian 矩阵函数的近似。重要的是,随机化仅用于用于列选择的得分计算,而非得分本身的选择。对于确定性和矩阵无格式化算法,我们相对于 DPP 采样的预期性能以及在特定情景下的恰好最优子集选择的性能均有有利的界限。一般情况需要新的 DPP 期望分析。最后,我们在多样化的示例近似任务上展示了算法的强大实际性能。
引用
@article{arxiv.2407.01698,
title = {Column and row subset selection using nuclear scores: algorithms and theory for Nystr\"{o}m approximation, CUR decomposition, and graph Laplacian reduction},
author = {Mark Fornace and Michael Lindsey},
journal= {arXiv preprint arXiv:2407.01698},
year = {2024}
}