中文

I-Segmenter:面向高效语义分割的纯整数视觉Transformer

计算机视觉与模式识别 2025-09-15 v1 人工智能 机器学习

摘要

视觉Transformer (ViTs) 近期在语义分割任务上取得了显著成果,但由于其高内存占用和计算成本,在资源受限设备上的部署仍然受限。量化是提高效率的有效策略,但基于 ViT 的分割模型在低精度下极易受影响,因为量化误差会在深层编码器-解码器流水线中累积。我们提出了 I-Segmenter,这是首个完全纯整数的 ViT 分割框架。I-Segmenter 基于 Segmenter 架构,系统地将浮点运算替换为纯整数对应运算。为进一步稳定训练和推理,我们提出了 λ\lambda-ShiftGELU,这是一种新型激活函数,旨在缓解均匀量化在处理长尾激活分布时的局限性。此外,我们移除了 L2 归一化层,并将解码器中的双线性插值替换为最近邻上采样,确保整个计算图中均为纯整数执行。大量实验表明,I-Segmenter 在与其 FP32 基线相比精度损失在合理范围内(平均 5.1%)的同时,将模型大小缩减了高达 3.8 倍,并通过优化的运行时实现了高达 1.2 倍的推理加速。值得注意的是,即使在使用单张校准图像的一次性训练后量化 (PTQ) 中,I-Segmenter 也能提供有竞争力的精度,突显了其在实际部署中的实用性。

关键词

引用

@article{arxiv.2509.10334,
  title  = {I-Segmenter: Integer-Only Vision Transformer for Efficient Semantic Segmentation},
  author = {Jordan Sassoon and Michal Szczepanski and Martyna Poreba},
  journal= {arXiv preprint arXiv:2509.10334},
  year   = {2025}
}