中文

FlexiViT:一种适用于所有斑块尺寸的单模型

计算机视觉与模式识别 2023-03-27 v2 人工智能 机器学习

摘要

视觉 Transformer 通过将图像切片为斑块将其转换为序列。这些斑块的尺寸控制速度/精度权衡,较小斑块以更大计算代价带来更高精度,但改变斑块尺寸通常需要重新训练模型。本文中,我们证明仅在训练时随机化斑块尺寸即可得到一组在广泛斑块尺寸范围内表现良好的权重,使得部署时可根据不同计算预算定制模型。我们广泛评估了所得模型(称为 FlexiViT)在分类、图像-文本检索、开放世界检测、全景分割与语义分割等广泛任务上的表现,结论是它通常匹配、且有时超越在单一斑块尺寸下训练的标准 ViT 模型(其他设置完全相同)。因此,FlexiViT 训练是 ViT 的简单即插即用改进,可轻松为大多数依赖 ViT 骨干架构的模型添加计算自适应能力。代码与预训练模型见 https://github.com/google-research/big_vision

关键词

引用

@article{arxiv.2212.08013,
  title  = {FlexiViT: One Model for All Patch Sizes},
  author = {Lucas Beyer and Pavel Izmailov and Alexander Kolesnikov and Mathilde Caron and Simon Kornblith and Xiaohua Zhai and Matthias Minderer and Michael Tschannen and Ibrahim Alabdulmohsin and Filip Pavetic},
  journal= {arXiv preprint arXiv:2212.08013},
  year   = {2023}
}

备注

Code and pre-trained models available at https://github.com/google-research/big_vision. All authors made significant technical contributions. CVPR 2023