中文

基于数据无关知识迁移的 Vision Transformer 优化

计算机视觉与模式识别 2024-08-13 v1

摘要

自然语言处理(NLP)任务中Transformer的突破性性能,使其取代了传统卷积神经网络(CNN),这得益于其通过自注意力机制实现的效率与准确性。这种成功激发了研究人员探索将Transformer应用于计算机视觉任务,以实现更长期的语义感知。Vision Transformer(ViT)凭借其捕捉长程依赖的能力,通过自注意力机制,在各种计算机视觉任务中表现卓越。当代ViT如Data Efficient Transformers(DeiT)能够有效地从图像中学习全局语义信息和局部纹理信息,实现与传统CNN相当的性能。然而,这些令人瞩目的性能得益于参数规模庞大,导致高计算成本,阻碍其在智能手机、摄像机、无人机等资源受限设备的部署。此外,ViT需要大量数据才能实现与基准CNN模型相当的性能。因此,我们确定了部署ViT到小型化设备时的两个关键挑战:大模型的高计算需求以及需要大量训练数据。为了解决这些挑战,我们提出一种利用知识蒸馏(KD)压缩大规模ViT模型的方法,该方法在数据无关(data-free)条件下实现,以规避数据可得性限制。此外,我们在同一实验环境中对目标检测任务进行了实验,除了分类任务。通过分析,我们发现数据无关知识蒸馏是克服这两大问题的有效方法,使ViT能够在资源受限较少的设备上部署。

关键词

引用

@article{arxiv.2408.05952,
  title  = {Optimizing Vision Transformers with Data-Free Knowledge Transfer},
  author = {Gousia Habib and Damandeep Singh and Ishfaq Ahmad Malik and Brejesh Lall},
  journal= {arXiv preprint arXiv:2408.05952},
  year   = {2024}
}