超级模型生态系统:一种领域自适应的视角
机器学习
2022-08-31 v1 人工智能
机器学习
摘要
本文试图通过领域自适应为新兴的超级模型范式建立理论基础,该范式首先在海量的数据上训练一个非常大尺度的模型,即超级模型(或其他文献中的基础模型),然后将其适配到各种特定领域。超级模型范式有助于降低计算与数据成本以及碳排放,这对人工智能产业至关重要,尤其是数量庞大的中小企业。我们将超级模型范式建模为一个两阶段扩散过程:(1)在预训练阶段,模型参数从随机初始化扩散并收敛到稳态分布;(2)在微调阶段,模型参数被迁移到另一个稳态分布。两个训练阶段均可由 Uhlenbeck-Ornstein 过程在数学上建模,该过程分别收敛到两个 Maxwell-Boltzmann 分布,每个分布刻画了相应的收敛模型。随后通过 PAC-Bayesian 框架建立了 的泛化界。该理论发现微调阶段的泛化误差在领域自适应中占主导地位。此外,我们的理论表明,泛化由一个刻画源域与目标域之间领域差异的新度量决定,该度量基于收敛局部极小值的协方差矩阵与偏移。
引用
@article{arxiv.2208.14092,
title = {Super-model ecosystem: A domain-adaptation perspective},
author = {Fengxiang He and Dacheng Tao},
journal= {arXiv preprint arXiv:2208.14092},
year = {2022}
}