中文

基于简单性原则的分布外泛化

机器学习 2025-05-29 v1 机器学习 统计理论 统计理论

摘要

现代基础模型展现出了卓越的分布外(OOD)泛化能力,能够解决远超其训练数据支持范围的任务。然而,支撑这一现象的理论原理仍然难以捉摸。本文通过考察扩散模型在图像生成中的组合泛化能力来研究这一问题。我们的分析表明,虽然神经网络架构具有足够的表达能力来表示广泛的模型——包括许多在 OOD 输入上表现出不良行为的模型——但符合人类预期的真正可泛化模型,通常对应于与训练数据一致的最简单模型。受此观察启发,我们开发了一个基于简单性的 OOD 泛化理论框架,并使用预定义的简单性度量进行量化。我们分析了两种关键情形:(1) 常数间隙设定,其中真实模型严格比所有伪替代模型简单一个固定间隙;(2) 消失间隙设定,其中固定间隙被一个平滑性条件取代,确保在简单性上接近真实模型的模型产生相似的预测。针对这两种情形,我们研究了正则化最大似然估计器,并首次为学习真实、可泛化、简单的模型建立了精确的样本复杂度保证。

关键词

引用

@article{arxiv.2505.22622,
  title  = {Principled Out-of-Distribution Generalization via Simplicity},
  author = {Jiawei Ge and Amanda Wang and Shange Tang and Chi Jin},
  journal= {arXiv preprint arXiv:2505.22622},
  year   = {2025}
}