中文

嵌套层次化 Transformer:面向精确、数据高效且可解释的视觉理解

计算机视觉与模式识别 2022-01-03 v4

摘要

层次化结构在近期视觉 Transformer 中颇为流行,然而它们需要精巧的设计和海量数据集才能表现良好。本文中,我们探索在非重叠图像块上嵌套基本局部 Transformer 并以层次化方式聚合它们的思路。我们发现块聚合函数在实现跨块非局部信息通信方面起着关键作用。该观察促使我们设计了一种简化架构,仅需在原始视觉 Transformer 上做少量代码改动。所提出的审慎选取设计具有三重优势:(1)NesT 收敛更快,且需要少得多的训练数据即可在 ImageNet 和 CIFAR 等小数据集上实现良好泛化;(2)将我们的核心思路拓展至图像生成时,NesT 带来了一种强大的解码器,比先前基于 Transformer 的生成器快 8×\times;(3)我们展示了通过此嵌套层次解耦特征学习与抽象过程,能够构建一种用于可视化解释所学模型的新型方法(命名为 GradCAT)。源代码见 https://github.com/google-research/nested-transformer。

关键词

引用

@article{arxiv.2105.12723,
  title  = {Nested Hierarchical Transformer: Towards Accurate, Data-Efficient and Interpretable Visual Understanding},
  author = {Zizhao Zhang and Han Zhang and Long Zhao and Ting Chen and Sercan O. Arik and Tomas Pfister},
  journal= {arXiv preprint arXiv:2105.12723},
  year   = {2022}
}

备注

AAAI2022