中文

面向资源高效训练的视觉模型递归块对角耦合

计算机视觉与模式识别 2026-05-25 v1

摘要

从头训练高容量视觉模型需要大量计算资源。为提高面向广泛目标模型的训练效率,现有增长方法常常假设可用较窄的模型,从而掩盖了整个管道的真实计算成本。我们提出一种高效训练协议 RBDC,通过参数无关的方式递归地将较窄、独立训练的模型以块对角方式耦合,以构建宽模型。这使得在所有参与模型之间的训练预算能够灵活分配。我们在 ImageNet 上评估了视觉转换器(DeiT)和卷积网络(ResNet),表明 RBDC 训练协议比从头训练的标准协议在效率上高出很多,在类似测试准确率下实现 30% 的 FLOPs 降低。它还在相同训练 FLOPs 下实现更高的性能,优于来自模型增长文献中的训练协议。最后,我们展示这些模型对于下游目标检测和实例分割任务可作为更好的 backbone。

关键词

引用

@article{arxiv.2605.23656,
  title  = {Recursive Block-Diagonal Coupling for Resource-Efficient Training of Vision Models},
  author = {Maxim Henry and Adrien Deliège and Sébastien Piérard and Marc Van Droogenbroeck},
  journal= {arXiv preprint arXiv:2605.23656},
  year   = {2026}
}

备注

22 pages, 3 figures, 4 tables, and 34 references