中文

非凸经验风险最小化中的拓扑平凡化

统计理论 2026-02-17 v1 统计理论

摘要

给定数据 {(xi,yi):in}\{({\boldsymbol x}_i,y_i): i\le n\},其中 xi{\boldsymbol x}_i 为标准 dd 维高斯特征向量,yiRy_i\in{\mathbb R} 为响应变量,我们研究学习参数为 θRd{\boldsymbol \theta}\in{\mathbb R}^d 的模型,通过最小化依赖于 θ{\boldsymbol \theta} 经过一维投影 θTxi的损失函数。虽然以往工作大多针对凸损失函数,但本文假设一般(非凸)损失函数,从而涵盖如感知机和非凸鲁棒回归等经典且尚未充分理解的例子。我们利用KacRice公式控制经验风险局部最小值预期个数的渐近行为,在比例渐近{\boldsymbol \theta}^{\sf T}{\boldsymbol x}_i 的损失函数。虽然以往工作大多针对凸损失函数,但本文假设一般(非凸)损失函数,从而涵盖如感知机和非凸鲁棒回归等经典且尚未充分理解的例子。我们利用 Kac-Rice 公式控制经验风险局部最小值预期个数的渐近行为,在比例渐近 n,d\to\inftyn/d\to\alpha >1的条件下。具体证明了经验风险局部最小值预期个数指数增长率的有限维变分公式。进一步给出充分条件,使得指数增长率消失,所有经验风险最小化解在渐近意义上具有相同的性质(实际上,我们期望在这些情况下最小解是唯一的)。我们将这一现象称为“速率平凡化”。若总体风险具有唯一最小解,则当样本/参数比 的条件下。具体证明了经验风险局部最小值预期个数指数增长率的有限维变分公式。进一步给出充分条件,使得指数增长率消失,所有经验风险最小化解在渐近意义上具有相同的性质(实际上,我们期望在这些情况下最小解是唯一的)。我们将这一现象称为“速率平凡化”。若总体风险具有唯一最小解,则当样本/参数比 \alpha大于某个适当常数 大于某个适当常数 \alpha_{\star}时,通常会满足速率平凡化的充分条件。以往此类一般性结果要求 时,通常会满足速率平凡化的充分条件。以往此类一般性结果要求 n\ge Cd \log d。我们以非凸鲁棒回归为例说明。基于启发式论证和数值模拟,我们提出了精确的平凡化相变点。我们以非凸鲁棒回归为例说明。基于启发式论证和数值模拟,我们提出了精确的平凡化相变点 \alpha_{\text{tr}}$ 的猜测。

关键词

引用

@article{arxiv.2602.14969,
  title  = {Topological trivialization in non-convex empirical risk minimization},
  author = {Andrea Montanari and Basil Saeed},
  journal= {arXiv preprint arXiv:2602.14969},
  year   = {2026}
}

备注

33 pages; 16 pdf figures