中文

并非所有任务均等量化:面向视觉几何Transformer的Fisher引导量化

计算机视觉与模式识别 2026-05-25 v2

摘要

以视觉几何基座Transformer(VGGT)为代表的前馈三维重建模型,可在单次前向传播中联合预测深度估计、相机位姿预测和点云重建等多个视觉几何任务。它们已在三维视觉应用中被广泛采用,但其十亿级参数量带来了巨大的内存和计算开销,给端侧部署带来了挑战。训练后量化(PTQ)是降低此类开销的有效技术。现有的前馈三维模型PTQ方法主要侧重于处理重尾激活分布和构建多样化的校准数据集。然而,我们观察到前馈三维模型通过共享骨干网络预测多个几何属性,其中不同的Transformer模块和隐藏通道对各任务的贡献截然不同,导致不同任务、模块和通道对量化误差的敏感度存在显著差异。因此,平等对待所有任务会过度强调不敏感的任务,并导致敏感任务出现显著的精度损失。为解决这一问题,我们针对前馈三维重建模型提出了Fisher引导量化(FGQ)。具体而言,FGQ利用对角Fisher信息矩阵来量化不同任务、模块和通道间的敏感度差异,并在校准过程中将这些敏感度融入可学习仿射变换,以更好地保留对每个任务最关键的通道和模块。在相机位姿估计、点图重建和深度估计上的大量实验表明,FGQ在VGGT上始终优于最先进的量化基线方法,在4位量化下实现了高达39%的相对提升。代码已开源:https://github.com/ypzhng/FGQ。

关键词

引用

@article{arxiv.2605.15828,
  title  = {Not All Tasks Quantize Equally: Fisher-Guided Quantization for Visual Geometry Transformer},
  author = {Yipu Zhang and Jintao Cheng and Weilun Feng and Jiehao Luo and Chuanguang Yang and Zhulin An and Yongjun Xu and Wei Zhang},
  journal= {arXiv preprint arXiv:2605.15828},
  year   = {2026}
}