TVT:在微小数据集上免训练搜索视觉 Transformer
计算机视觉与模式识别
2023-11-27 v1
摘要
提出免训练的视觉 Transformer(ViT)架构搜索,利用零成本代理搜索更优的 ViT。尽管 ViT 在小型数据集上从 CNN 教师模型获得显著蒸馏增益,但根据我们的实验观察,当前 ViT 中的零成本代理不能很好地推广到蒸馏训练范式。在本文中,我们首次研究如何在教师模型辅助下以免训练方式搜索,并设计了一个有效的免训练 ViT(TVT)搜索框架。首先,我们观察到 ViT 与 ConvNet 教师之间注意力图的相似性显著影响蒸馏精度。因此,我们提出了一种基于师生特征注意力关系的教师感知度量。此外,TVT 采用学生权重的 L2 范数作为学生能力度量以提升排序一致性。最后,TVT 通过我们的教师感知度量与学生能力度量搜索用于与 ConvNet 教师蒸馏的最佳 ViT,在效率与效果上均取得显著提升。在各种微小数据集和搜索空间上的大量实验表明,我们的 TVT 优于最先进的免训练搜索方法。代码将公开。
引用
@article{arxiv.2311.14337,
title = {TVT: Training-Free Vision Transformer Search on Tiny Datasets},
author = {Zimian Wei and Hengyue Pan and Lujun Li and Peijie Dong and Zhiliang Tian and Xin Niu and Dongsheng Li},
journal= {arXiv preprint arXiv:2311.14337},
year = {2023}
}