FilterViT与DropoutViT
计算机视觉与模式识别
2024-11-12 v3
摘要
在本研究中,我们引入了ViT的增强版本,该版本在下采样的初始阶段进行基于注意力的QKV操作。由于高分辨率特征图尺寸大且包含大量令牌,直接在其上进行注意力计算计算量很大。为了缓解这个问题,我们提出了一种过滤注意力机制,该机制使用一个过滤块(Filter Block)来创建一个显著掩码(Filter Mask),用于选择信息量最大的像素进行注意力计算。过滤块对特征图的像素进行评分,我们对这些分数进行排序,只保留前K个像素(K在各层之间变化)。这种方法有效减少了参与注意力计算的令牌数量,降低了计算复杂度并提高了处理速度。此外,显著掩码提供了可解释性,因为模型专注于图像中对结果最关键的区域。我们的实验结果表明,该模型在提高准确性的同时,提高了参数效率和计算速度。与现有模型相比,我们的方法在保持高性能的同时显著降低了资源消耗。
引用
@article{arxiv.2410.22709,
title = {FilterViT and DropoutViT},
author = {Bohang Sun},
journal= {arXiv preprint arXiv:2410.22709},
year = {2024}
}