中文

MSViT:面向视觉 Transformer 的动态混合尺度分词

计算机视觉与模式识别 2023-09-08 v2

摘要

输入 Vision Transformer 的 token 几乎不携带语义信息,因为它们被定义为输入图像的规则等尺寸块,而不论其内容如何。然而,处理图像中均匀背景区域不应需要如同密集杂乱区域那样多的计算量。为解决此问题,我们提出了一种用于 ViT 的动态混合尺度分词方案,MSViT。我们的方法引入条件门控机制,为每个图像区域选择最优 token 尺度,从而 token 数量按输入动态确定。此外,为增强门控在训练期间的条件行为,我们引入了一种 batch-shaping 损失的新型推广。我们表明,尽管门控模块在粗块级别局部操作,其仍能够学习有意义的语义。所提门控模块轻量、与 transformer 主干选择无关,并在少量轮次内以极低训练开销完成训练。此外,与 token 剪枝不同,MSViT 不丢失关于输入的信息,因此可直接应用于密集任务。我们在分类与分割任务上验证了 MSViT,其带来了精度–复杂度权衡的改善。

关键词

引用

@article{arxiv.2307.02321,
  title  = {MSViT: Dynamic Mixed-Scale Tokenization for Vision Transformers},
  author = {Jakob Drachmann Havtorn and Amelie Royer and Tijmen Blankevoort and Babak Ehteshami Bejnordi},
  journal= {arXiv preprint arXiv:2307.02321},
  year   = {2023}
}

备注

ICCV Workshops 2023; Code for the Generalized Batch-Shaping loss is available at https://github.com/Qualcomm-AI-research/batchshaping