中文

Hiera:去除花哨组件的层次化视觉 Transformer

计算机视觉与模式识别 2023-06-02 v1 机器学习

摘要

现代层次化视觉 Transformer 为追求监督分类性能,添加了若干视觉专用组件。尽管这些组件带来了有效的准确率和诱人的 FLOP 计数,但所增加的复杂性实际上使这些 Transformer 比其原始 ViT 对应模型更慢。本文中,我们主张这种额外负担是不必要的。通过用强视觉 pretext 任务(MAE)进行预训练,我们可从最先进的多阶段视觉 Transformer 中剥离所有花哨组件而不损失精度。在此过程中,我们创建了 Hiera,一种极简的层次化视觉 Transformer,比先前模型更准确,同时在推理和训练时都显著更快。我们在图像与视频识别的多种任务上评估了 Hiera。我们的代码和模型见 https://github.com/facebookresearch/hiera。

关键词

引用

@article{arxiv.2306.00989,
  title  = {Hiera: A Hierarchical Vision Transformer without the Bells-and-Whistles},
  author = {Chaitanya Ryali and Yuan-Ting Hu and Daniel Bolya and Chen Wei and Haoqi Fan and Po-Yao Huang and Vaibhav Aggarwal and Arkabandhu Chowdhury and Omid Poursaeed and Judy Hoffman and Jitendra Malik and Yanghao Li and Christoph Feichtenhofer},
  journal= {arXiv preprint arXiv:2306.00989},
  year   = {2023}
}

备注

ICML 2023 Oral version. Code+Models: https://github.com/facebookresearch/hiera