高维情形下去偏随机斜投影用于子样本 OLS 与快速 CUR
数值分析
2026-05-26 v1 数值分析
机器学习
摘要
随机抽样是现代机器学习和数值线性代数中用于降低大规模矩阵问题计算成本的基本工具。然而,现有分析主要依赖子空间嵌入保证,无法精确刻画由抽样诱导的非线性随机斜投影的统计偏差,这种偏差在子样本最小二乘和快速低秩逼近方法中随处可见。由于(伪)逆运算是非线性的,这些随机斜投影即使底层抽样无偏,也会系统性偏斜,从而在下游最小二乘和低秩逼近解决方案中引入隐藏偏差。本文发展了随机斜投影在高维情形下的统一非渐近理论。我们表明,标准随机抽样方案通常会引起系统统计偏差,传统的子空间嵌入式分析未能捕捉这一现象,我们提出了纠正偏差的原则框架。我们通过两个典型应用展示了理论的力量。对于子样本最小二乘,我们获得尖锐的偏差-方差特征,揭示了广泛使用的抽样方案的统计次优性,确定何时进行纠偏可获得可证明的改进。对于快速 CUR 分解,我们发展了一种去偏方法,实现更高的逼近精度。数值实验进一步验证了我们的理论发现。
引用
@article{arxiv.2605.24955,
title = {Debiasing Random Oblique Projections for Subsampled OLS and Fast CUR in High Dimensions},
author = {Chengmei Niu and Sachin Garg and Michał Dereziński and Zhenyu Liao},
journal= {arXiv preprint arXiv:2605.24955},
year = {2026}
}
备注
52 pages, 4 figure, and 4 tables