中文

DropKey:一种以键为丢弃单元并采用递减丢弃率调度视觉Transformer自注意力层的方法

计算机视觉与模式识别 2023-04-12 v4

摘要

本文着重分析并改进视觉Transformer(Vision Transformer)自注意力层中的dropout技术,该技术十分重要却出人意料地被先前工作所忽视。具体而言,我们围绕三个核心问题展开研究:第一,在自注意力层中丢弃什么?与文献中丢弃注意力权重的做法不同,我们提出将dropout操作前移至注意力矩阵计算之前,并以Key作为丢弃单元,从而得到一种新颖的softmax前丢弃方案。我们从理论上验证该方案有助于保持注意力权重的正则化与概率特征,缓解对特定模式的过拟合问题,并增强模型全局捕获关键信息的能力;第二,如何在连续层中调度丢弃率?与对所有层采用恒定丢弃率不同,我们提出一种新的递减调度,沿自注意力层堆叠逐步降低丢弃率。我们通过实验验证所提调度可避免低层特征过拟合与高层语义缺失,从而提升模型训练的鲁棒性与稳定性;第三,是否需要像CNN那样执行结构化dropout操作?我们尝试基于图像块的块版本dropout操作,发现这一对CNN有用的技巧对ViT并非必要。基于对上述三个问题的探索,我们提出新颖的DropKey方法,将Key视为丢弃单元并采用递减的丢弃率调度,以通用方式改进ViT。综合实验证明了DropKey对各种ViT架构(如T2T和VOLO)以及各种视觉任务(如图像分类、目标检测、人-物交互检测以及人体形状恢复)的有效性。

关键词

引用

@article{arxiv.2208.02646,
  title  = {DropKey},
  author = {Bonan Li and Yinhan Hu and Xuecheng Nie and Congying Han and Xiangjian Jiang and Tiande Guo and Luoqi Liu},
  journal= {arXiv preprint arXiv:2208.02646},
  year   = {2023}
}

备注

Accepted by CVPR2023