中文

TerViT:一种高效的三值视觉Transformer

计算机视觉与模式识别 2022-01-24 v2 机器学习

摘要

视觉 Transformer(ViTs)已在多种视觉任务中展现出巨大潜力,但在资源受限设备上部署时面临高昂的计算与内存成本问题。本文引入一种三值视觉 Transformer(TerViT)对 ViTs 中的权重进行三值化,其难点在于实值与三值参数间较大的损失曲面差距。为应对该问题,我们提出一种渐进式训练方案:先训练 8-bit Transformer,再训练 TerViT,从而比常规方法获得更优优化。此外,我们引入通道级三值化,将每个矩阵划分为不同通道,各通道具有独特分布与三值化区间。我们将方法应用于流行的 DeiT 与 Swin 骨干网络,大量结果表明我们能取得有竞争力的性能。例如,TerViT 可将 Swin-S 量化为 13.1MB 模型大小,同时在 ImageNet 数据集上达到 79% 以上的 Top-1 准确率。

关键词

引用

@article{arxiv.2201.08050,
  title  = {TerViT: An Efficient Ternary Vision Transformer},
  author = {Sheng Xu and Yanjing Li and Teli Ma and Bohan Zeng and Baochang Zhang and Peng Gao and Jinhu Lv},
  journal= {arXiv preprint arXiv:2201.08050},
  year   = {2022}
}