中文

用于视觉识别的 $2^L$ 个子模型协同训练

计算机视觉与模式识别 2022-12-12 v1

摘要

我们引入子模型协同训练,一种与协同训练、自蒸馏和随机深度相关的正则化方法。给定待训练的神经网络,对于每个样本,我们通过随机深度隐式实例化两个改变的网络——“子模型”:仅激活层的一个子集。每个网络通过提供补充独热标签所给常规损失的损失,充当另一个网络的软教师。我们的方法称为cosub,使用单一权重集合,且不涉及预训练外部模型或时间平均。实验上,我们展示了子模型协同训练可有效训练用于图像分类与语义分割等识别任务的骨干网络。我们的方法兼容多种架构,包括RegNet、ViT、PiT、XCiT、Swin和ConvNext。我们的训练策略在可比设置下提升了它们的效果。例如,在ImageNet-21k上用cosub预训练的ViT-B在ImageNet-val上获得87.4%的top-1准确率 @448。

关键词

引用

@article{arxiv.2212.04884,
  title  = {Co-training $2^L$ Submodels for Visual Recognition},
  author = {Hugo Touvron and Matthieu Cord and Maxime Oquab and Piotr Bojanowski and Jakob Verbeek and Hervé Jégou},
  journal= {arXiv preprint arXiv:2212.04884},
  year   = {2022}
}