中文

面向灵活推理的视觉Transformer切片技术

计算机视觉与模式识别 2024-12-09 v1 机器学习

摘要

视觉Transformer(ViT)以其可扩展性而著称。本文旨在将ViT缩小以适应资源约束动态变化的环境。我们观察到,较小的ViT本质上是较大ViT的子网络,具有不同的宽度。因此,我们提出一种通用框架,称为Scala,使单个网络能够表示多个较小的ViT,从而实现灵活的推理能力,这与ViT可变宽度的本质设计相吻合。具体而言,Scala在训练期间激活多个子网,引入孤立激活以将最小子网络从其他子网络中 disentangle,并利用规模协调确保每个子网络接收简化、稳定且准确的学习目标。在不同任务上的全面实证验证表明,仅通过一次性训练,Scala学习到无需修改原始ViT结构的精细网络表示,并与单独训练的性能相当。与现有方法相比,Scala在ImageNet-1K上平均提升1.6%,且参数更少。

关键词

引用

@article{arxiv.2412.04786,
  title  = {Slicing Vision Transformer for Flexible Inference},
  author = {Yitian Zhang and Huseyin Coskun and Xu Ma and Huan Wang and Ke Ma and Xi and Chen and Derek Hao Hu and Yun Fu},
  journal= {arXiv preprint arXiv:2412.04786},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024