面向可扩展视觉模型初始化的自监督权重模板
计算机视觉与模式识别
2026-01-28 v1 机器学习
摘要
现代模型参数的规模和复杂性凸显了预训练模型的重要性。然而,部署常常需要不同大小的架构,暴露了传统预训练和微调的局限性。为此,我们提出了SWEET框架,进行自监督约束式预训练,以实现视觉任务中可扩展的初始化。与预训练固定大小模型不同,我们学习共享权重模板和特定于大小的权重缩放器,基于Tucker分解,这促进模块化并支持对深度和宽度各异的架构进行灵活适应。随后,目标模型通过组合和重新缩放模板来初始化,其参数可以通过轻量级权重缩放器从最小训练数据中高效学习。为进一步增强宽度扩展的灵活性,我们引入了沃特向随机缩放,这在宽度相关维度上对模板进行正则化,鼓励鲁棒且宽度不变的表征,以实现更好的跨宽度泛化。在分类、检测、分割和生成任务上的大量实验表明,SWEET在初始化可变大小视觉模型方面表现出色,实现了最先进的性能。
引用
@article{arxiv.2601.19694,
title = {Self-Supervised Weight Templates for Scalable Vision Model Initialization},
author = {Yucheng Xie and Fu Feng and Ruixiao Shi and Jing Wang and Yong Rui and Xin Geng},
journal= {arXiv preprint arXiv:2601.19694},
year = {2026}
}