基于操作重排的视觉 Transformer 低位整数化以实现高效硬件
机器学习
2025-08-06 v2 计算机视觉与模式识别
系统与控制
系统与控制
摘要
预训练的视觉 Transformer 在 various visual tasks 上取得了显著的性能,但因计算和内存成本高昂而受到制约。虽然模型量化通过降低精度降低内存使用,但这些模型仍因矩阵运算前的去量化导致计算开销显著。本文分析了计算图谱,提出基于操作重排的整数化过程。具体而言,该过程推迟矩阵运算后的去量化,从而实现对量化输入的直接处理,进而实现整数化的矩阵乘法和线性模块。为验证 our 方法,我们在基于 systolic array 的硬件上合成了 ViT 的自注意力模块。实验结果表明,我们的低位推理显著降低了线性层和矩阵乘法每个 PE 的功耗,弥合了量化模型与高效推理之间的差距。
关键词
引用
@article{arxiv.2504.18547,
title = {Low-Bit Integerization of Vision Transformers using Operand Reordering for Efficient Hardware},
author = {Ching-Yi Lin and Sahil Shah},
journal= {arXiv preprint arXiv:2504.18547},
year = {2025}
}
备注
4 pages + references, 5 figures, 2 tables in IEEE double column conference template