中文

ImagePiece:内容感知的高效图像识别重分词策略

计算机视觉与模式识别 2024-12-24 v1

摘要

Vision Transformers(ViTs)在众多计算机视觉任务中取得了显著的成功。然而,ViTs 由于固有的依赖于多头自注意力(MHSA),导致计算成本巨大,促使人们努力加速 ViT 以适用于实际应用。为此,最近的工作旨在减少标记数量,主要关注如何有效剪枝或合并它们。然而,由于 ViT 标记是从非重叠网格块生成的,通常不足以传递足够的语义信息,这使得其与高效 ViT 不兼容。为此,我们提出ImagePiece,一种针对Vision Transformers的新颖重分词策略。遵循NLP 分词中的MaxMatch策略,ImagePiece 将语义不足但在局部上连贯的标记分组,直到它们能够传递意义。这种简单的重分词与之前的标记减少方法高度兼容,能够显著缩小相关标记范围,在ImageNet 分类准确率方面将DeiT-S的推理速度提高 54%(几乎快 1.5 倍),同时实现 0.39% 的准确率提升。对于超高速推理场景(加速 251%),我们的方法在准确率上超过其他基线方法 8%。

关键词

引用

@article{arxiv.2412.16491,
  title  = {ImagePiece: Content-aware Re-tokenization for Efficient Image Recognition},
  author = {Seungdong Yoa and Seungjun Lee and Hyeseung Cho and Bumsoo Kim and Woohyung Lim},
  journal= {arXiv preprint arXiv:2412.16491},
  year   = {2024}
}

备注

Accepted to AAAI 2025