链式模型预训练:重新思考视觉基础模型训练加速
计算机视觉与模式识别
2026-04-15 v1 人工智能
摘要
本文提出 Chain-of-Models Pre-Training(CoM-PT),这是一种无性能损失的视觉基础模型(VFM)训练加速方法。该方法在核心动机上与现有加速方法根本不同:与其针对每个模型 individually 优化,不如在模型族层面加速训练管道,随模型族规模而高效扩展。具体而言,CoM-PT 为模型族建立一个预训练序列,按模型规模升序排列,称为模型链。在该链中,仅最小模型进行标准的 individual 预训练,而其他模型通过从较小的前驱模型进行逆向知识迁移来高效训练,同时共用参数空间和特征空间中的知识。结果,CoM-PT 使所有模型均能实现大多数情况下优于标准 individual 训练的性能,同时显著降低训练成本,这在 45 个数据集上进行了广泛验证,涵盖 zero-shot 和 fine-tuning 任务。值得注意的是,其高效扩展特性导致了一种显著的现象:训练更多模型反而更高效。例如,在 CC3M 上:i) 给定 ViT-L 为最大模型,逐步在模型链中添加更小的模型可将计算复杂度降低最高 72%;ii) 在固定模型规模范围内,随着 VFM 族在 3、4 和 7 个模型上规模化,CoM-PT 的加速比从 4.13X 跳升至 5.68X 和 7.09X。由于 CoM-PT 天然与特定预训练范式无关,我们开源代码以催化更计算密集型场景(如大语言模型预训练)的进一步扩展。
引用
@article{arxiv.2604.12391,
title = {Chain-of-Models Pre-Training: Rethinking Training Acceleration of Vision Foundation Models},
author = {Jiawei Fan and Shigeng Wang and Chao Li and Xiaolong Liu and Anbang Yao},
journal= {arXiv preprint arXiv:2604.12391},
year = {2026}
}
备注
This work is accepted to CVPR 2026. Code is available at https://github.com/deep-optimization/CoM-PT