嵌套层次化 Transformer:面向精确、数据高效且可解释的视觉理解
计算机视觉与模式识别
2022-01-03 v4
摘要
层次化结构在近期视觉 Transformer 中颇为流行,然而它们需要精巧的设计和海量数据集才能表现良好。本文中,我们探索在非重叠图像块上嵌套基本局部 Transformer 并以层次化方式聚合它们的思路。我们发现块聚合函数在实现跨块非局部信息通信方面起着关键作用。该观察促使我们设计了一种简化架构,仅需在原始视觉 Transformer 上做少量代码改动。所提出的审慎选取设计具有三重优势:(1)NesT 收敛更快,且需要少得多的训练数据即可在 ImageNet 和 CIFAR 等小数据集上实现良好泛化;(2)将我们的核心思路拓展至图像生成时,NesT 带来了一种强大的解码器,比先前基于 Transformer 的生成器快 8;(3)我们展示了通过此嵌套层次解耦特征学习与抽象过程,能够构建一种用于可视化解释所学模型的新型方法(命名为 GradCAT)。源代码见 https://github.com/google-research/nested-transformer。
引用
@article{arxiv.2105.12723,
title = {Nested Hierarchical Transformer: Towards Accurate, Data-Efficient and Interpretable Visual Understanding},
author = {Zizhao Zhang and Han Zhang and Long Zhao and Ting Chen and Sercan O. Arik and Tomas Pfister},
journal= {arXiv preprint arXiv:2105.12723},
year = {2022}
}
备注
AAAI2022