中文

线性回归中的最优算法在协变量漂移下:关于预条件的重要性

机器学习 2025-02-14 v1 机器学习

摘要

现代统计学习中的常见目标是在源数据分布之外获得满意的概括。即便在线性模型的标准协变量漂移设定下,这一挑战仍未在理论上得到解决。本文研究了基础(高维)线性回归,其中ground truth变量受椭圆形约束,并就此范畴内回答两个根本问题:(i)给定目标协变量矩阵,协变量漂移下的最优算法是什么?(ii)哪些类型的目标类可以实现常用SGD类算法的最优性?我们的分析首先通过贝叶斯Cramer-Rao不等式建立紧致的下限概括。对于(i),我们证明最优估计量可简单地表示为源分布最佳估计量的某种线性变换。给定源和目标矩阵,我们显示该变换可通过凸规划有效计算。SGD的min-max最优分析利用了我们识别所应用算法的累积更新量以及理想变换作为学习变量的预条件的思想。我们提供了SGD及其加速变体实现最优性的充分条件。

关键词

引用

@article{arxiv.2502.09047,
  title  = {Optimal Algorithms in Linear Regression under Covariate Shift: On the Importance of Precondition},
  author = {Yuanshi Liu and Haihan Zhang and Qian Chen and Cong Fang},
  journal= {arXiv preprint arXiv:2502.09047},
  year   = {2025}
}