中文

GSB:面向训练样本有限的视觉 Transformer 的组叠加二值化

计算机视觉与模式识别 2024-01-19 v4

摘要

视觉 Transformer (ViT) 在各种计算机视觉任务中表现卓越。然而,受海量参数影响,ViT 在训练样本相对较少时通常面临严重的过拟合问题。此外,ViT 一般需要沉重的计算资源,限制了其在资源受限设备上的部署。作为一类模型压缩方法,模型二值化潜在地是解决上述问题的良好选择。与全精度模型相比,采用二值化方法的模型以简单按位二进制操作替代复杂张量乘法,并以仅 1 位的值表示全精度模型参数与激活,分别潜在地解决模型大小与计算复杂度问题。本文研究二值化 ViT 模型。经验上,我们观察到为卷积神经网络(CNN)设计的现有二值化技术不能很好地迁移到 ViT 的二值化任务。我们还发现二值 ViT 模型精度下降主要源于注意力模块与 Value 向量的信息损失。因此,我们提出一种新颖的模型二值化技术,称为组叠加二值化(GSB),以应对这些问题。此外,为进一步提升二值化模型性能,我们研究了二值化过程中的梯度计算流程,并推导出更适用于 GSB 的梯度计算等式以减小梯度失配的影响。随后,引入知识蒸馏技术以缓解模型二值化导致的性能退化。从分析上看,模型二值化可在模型训练时限制参数更新过程中的参数搜索空间……

引用

@article{arxiv.2305.07931,
  title  = {GSB: Group Superposition Binarization for Vision Transformer with Limited Training Samples},
  author = {Tian Gao and Cheng-Zhong Xu and Le Zhang and Hui Kong},
  journal= {arXiv preprint arXiv:2305.07931},
  year   = {2024}
}

备注

Accepted by Neural Networks