视觉配对学习:一种高效的图像分类训练框架
计算机视觉与模式识别
2021-12-03 v1
摘要
Transformer是一种在视觉任务中潜在强大的架构。尽管拥有更多参数和注意力机制,其性能目前并不像CNN那样占主导地位。CNN通常计算成本更低,并且仍是各种视觉任务中的主要竞争者。一个研究方向是采用CNN的成功思想并改进Transformer,但这往往依赖于精心设计和启发式的网络设计。观察到Transformer和CNN在表征学习和收敛速度上互补,我们提出了一种称为视觉配对学习(VPL)的高效训练框架用于图像分类任务。VPL构建了一个由Transformer分支、CNN分支和配对学习模块组成的网络。通过多阶段训练策略,VPL使各分支在训练过程的适当阶段向同伴学习,并以更少的时间成本使二者都取得更好性能。在无外部数据的情况下,VPL将ViT-Base和ResNet-50在ImageNet-1k验证集上的top-1准确率分别提升至83.47%和79.61%。在不同领域的其他数据集上的实验证明了VPL的有效性,并表明Transformer在与VPL中结构不同的CNN配对时表现更好。我们还通过消融研究分析了各组件的重要性。
引用
@article{arxiv.2112.00965,
title = {Vision Pair Learning: An Efficient Training Framework for Image Classification},
author = {Bei Tong and Xiaoyuan Yu},
journal= {arXiv preprint arXiv:2112.00965},
year = {2021}
}