中文

FTerViT: 完全三值视觉变换器

计算机视觉与模式识别 2026-05-21 v1

摘要

三值视觉变换器可实现显著的模型压缩,但最先进的方法仅对编码器层进行三值化,使 patch 嵌入、LayerNorm 参数和分类头保持全精度。在面向资源受限处理器(如微控制器)的紧凑模型中,这些剩余的全精度组件决定了总内存占用,严重限制了部署效率和设备可行性。本文我们提出一种完全三值化的视觉变换器,其中所有权重矩阵和归一化参数均进行三值化(FTerViT)。为此,我们引入了两种新型算子:用于 patch 嵌入的具有 per-channel 缩放的 TernaryBitConv2d 以及 TernaryLayerNorm。FTerViT 使用知识蒸馏进行训练,随后进行轻量级量子感知恢复阶段。我们的在 384×384 分辨率下的 ternary W2A8 DeiT-III-S 达到 82.43% ImageNet-1K top-1 准确率,仅 6.09 MB(约 15 倍压缩,较 FP32 低 2.42 pp),超越先前的三值 ViT 方法高出最高 8 pp。最后,我们在 ESP32-S3 系统单芯片内实现了三值视觉变换器的第一个实例。通过部署基于 DeiT-III-Small(224×224 分辨率,5.81 MB)的 FTerViT-Small,我们实现了 79.64% ImageNet-1K top-1 准确率。

关键词

引用

@article{arxiv.2605.21171,
  title  = {FTerViT: Fully Ternary Vision Transformer},
  author = {Szymon Ruciński and Pietro Bonazzi and Engin Türetken and Simon Narduzzi and Michele Magno and Nadim Maamari},
  journal= {arXiv preprint arXiv:2605.21171},
  year   = {2026}
}

备注

Preprint