基于约束的预训练:从结构化约束到可扩展的模型初始化
机器学习
2026-04-17 v1
摘要
预训练与微调范式已成为模型适配的主导方法。然而,传统的预训练通常产生固定规模的模型,而实际部署往往需要不同大小的模型,当目标模型规模与预训练期间使用的规模不同时,其局限性便暴露无遗。为了解决这一问题,我们提出了一种创新的基于约束的预训练范式,该范式在预训练期间施加结构化约束,将规模无关的知识解耦为可重用的权重模板,同时将特定规模的适配分配给轻量级权重缩放器,从而将可变规模模型初始化重新表述为多任务适配问题。在该范式内,我们进一步引入了 WeiT,它采用基于 Kronecker 的约束来正则化预训练过程。具体而言,模型参数被表示为通过拼接和加权聚合构成的权重模板,其自适应连接由轻量级权重缩放器控制,这些缩放器的参数从有限数据中学习获得。这种设计能够在不同下游规模上灵活高效地构建模型权重。大量实验证明了 WeiT 的有效性与高效性,在包括图像分类、图像生成和具身控制在内的广泛感知与具身学习任务中,在初始化不同深度和宽度的模型方面实现了最先进的性能。此外,其有效性还泛化至基于 Transformer 和基于卷积的架构,即使在全量训练下也能持续实现更快的收敛和更优的性能。
引用
@article{arxiv.2604.14769,
title = {Constraint-based Pre-training: From Structured Constraints to Scalable Model Initialization},
author = {Fu Feng and Yucheng Xie and Ruixiao Shi and Jing Wang and Xin Geng},
journal= {arXiv preprint arXiv:2604.14769},
year = {2026}
}