中文

IA-RED$^2$:面向视觉 Transformer 的可解释性感知冗余缩减

计算机视觉与模式识别 2021-10-28 v2

摘要

基于自注意力的模型 Transformer 近来正成为计算机视觉领域的领先骨干网络。尽管 Transformer 在多种视觉任务中取得了令人瞩目的成功,它仍受困于沉重的计算与内存开销。为应对此局限,本文提出一种可解释性感知冗余缩减框架(IA-RED2^2)。我们首先观察到大量冗余计算主要耗费在与输入不相关的图像块上,随后引入一个可解释模块来动态且平滑地丢弃这些冗余块。该新颖框架进一步扩展为分层结构,在不同阶段逐渐移除不相关的 token,从而显著缩减计算成本。我们在图像与视频任务上进行了大量实验,我们的方法可为 DeiT 和 TimeSformer 等最先进(SOTA)模型带来最高 1.4 倍的加速,且仅损失不到 0.7% 的精度。更重要的是,与其他加速方法相反,我们的方法具有内在可解释性并提供充分的视觉证据,使视觉 Transformer 在更轻量的同时更接近人类可理解的架构。我们证明,我们框架中自然涌现的可解释性在定性与定量结果上均优于原始视觉 Transformer 学到的原始注意力以及现成解释方法生成的注意力。项目主页:http://people.csail.mit.edu/bpan/ia-red/。

关键词

引用

@article{arxiv.2106.12620,
  title  = {IA-RED$^2$: Interpretability-Aware Redundancy Reduction for Vision Transformers},
  author = {Bowen Pan and Rameswar Panda and Yifan Jiang and Zhangyang Wang and Rogerio Feris and Aude Oliva},
  journal= {arXiv preprint arXiv:2106.12620},
  year   = {2021}
}

备注

Accepted in NeurIPS 2021