StablePCA:从多源数据中分布鲁棒地学习共享表示
机器学习
2026-03-10 v3 最优化与控制
统计计算
统计方法学
摘要
在合成多源高维数据时,一个关键目标是提取能有效逼近不同源中原始特征的低维表示。此类表示有助于发现可迁移结构,并有助于减轻批次效应等系统性偏差。我们提出稳定主成分分析(StablePCA),这是一个分布鲁棒的框架,通过最大化多个源上的最坏情况解释方差来构建稳定的潜在表示。将经典PCA扩展到多源场景的一个主要挑战在于非凸秩约束,这使得StablePCA公式成为一个非凸优化问题。为克服这一挑战,我们对StablePCA进行凸松弛,并开发了一种高效的镜像下降(Mirror-Prox)算法来求解该松弛问题,该算法具有全局收敛性保证。由于松弛问题通常与原始公式不同,我们进一步引入一个数据依赖的证书,以评估算法解决原始非凸问题的效果,并建立松弛是紧致的条件。最后,我们探索了基于不同损失函数的多源PCA的替代分布鲁棒公式。
引用
@article{arxiv.2505.00940,
title = {StablePCA: Distributionally Robust Learning of Shared Representations from Multi-Source Data},
author = {Zhenyu Wang and Molei Liu and Jing Lei and Francis Bach and Zijian Guo},
journal= {arXiv preprint arXiv:2505.00940},
year = {2026}
}