中文

视觉Transformer中良好分词器应具备哪些特性?

计算机视觉与模式识别 2022-12-22 v1

摘要

近年来在视觉任务中应用蓬勃发展的Transformer架构,已转向反对广泛使用的卷积范式。Transformer依赖于将输入分割为多个词元(token)的分词过程,能够利用自注意力提取词元间的两两关系。尽管分词是Transformer的基础构建模块,但在计算机视觉中,何种特性构成良好的分词器尚未被充分理解。本文从信息权衡的视角研究这一未知问题。除了统一并理解现有的结构修改外,我们的推导得出了视觉分词器的更好设计策略。所提出的跨词元调制(Modulation across Tokens, MoTo)通过归一化引入了词元间建模能力。此外,在标准训练流程中采用了一种正则化目标TokenProp。通过在多种Transformer架构上的大量实验,我们观察到这两种即插即用设计在可忽略的计算开销下带来了性能提升与有趣的特性。这些观察进一步表明了在视觉Transformer中常被忽视的分词器设计的重要性。

关键词

引用

@article{arxiv.2212.11115,
  title  = {What Makes for Good Tokenizers in Vision Transformer?},
  author = {Shengju Qian and Yi Zhu and Wenbo Li and Mu Li and Jiaya Jia},
  journal= {arXiv preprint arXiv:2212.11115},
  year   = {2022}
}

备注

To appear in IEEE Transactions on Pattern Analysis and Machine Intelligence