中文

On the Asymptotics of Self-Supervised Pre-training: Two-Stage M-Estimation and Representation Symmetry

机器学习 2026-03-31 v1 机器学习

摘要

自监督预训练是一种利用大规模无标签数据学习表征以供下游微调的技术,已成为现代机器学习的基石。虽然越来越多的理论工作开始分析这一范式,但现有的界限仍未回答当前速率的锐度问题,以及它们是否准确捕捉预训练与微调之间复杂相互作用。本文通过发展基于两阶段M估计的渐近预训练理论来弥补这一差距。一个关键挑战是预训练估计器通常仅可通过群对称性识别,这一特征在表征学习中常见,需谨慎处理。我们利用黎曼几何工具来研究预训练表征的内在参数,将其通过一种轨道不变性概念与下游预测器联系起来,精确刻画了下游测试风险的极限分布。我们将主要结果应用于几个案例研究,包括谱预训练、因子模型和高斯混合模型,在适用时比现有方法在特定因子上获得了实质性的改进。

关键词

引用

@article{arxiv.2603.27631,
  title  = {On the Asymptotics of Self-Supervised Pre-training: Two-Stage M-Estimation and Representation Symmetry},
  author = {Mohammad Tinati and Stephen Tu},
  journal= {arXiv preprint arXiv:2603.27631},
  year   = {2026}
}