中文

FQ-PETR:用于多视角三维目标检测的完全量化位置嵌入变换

计算机视觉与模式识别 2025-11-20 v4 人工智能

摘要

基于相机的多视角三维检测对于自动驾驶至关重要。PETR及其变体在基准测试中表现出色,但因计算成本高和内存占用大而面临部署挑战。量化是一种通过降低权重和激活的位宽来压缩深度神经网络的有效技术。然而,直接将现有量化方法应用于PETR会导致严重的精度退化。此问题主要源于两个关键挑战:(1)多模态特征之间的显著幅度差异——具体而言,图像特征和相机射线位置嵌入(PE);(2)对非线性算子进行量化的低效性和近似误差,这些算子通常依赖硬件不友好的计算。在本文中,我们提出了FQ-PETR,一个用于PETR的完全量化框架,具有三个关键创新:(1)量化友好的激光雷达射线位置嵌入(QFPE):用激光雷达先验引导的单点采样和基于锚点的嵌入替代多点采样,消除了问题性的非线性(如逆sigmoid),并将PE尺度与图像特征对齐,保持了精度。(2)双查找表(DULUT):该算法使用两个级联线性LUT近似复杂非线性函数,以少量条目实现高保真度且无需专用硬件。(3)量化后数值稳定化(QANS):在softmax数值稳定化之后执行量化,减轻了大输入引起的注意力失真。在PETR(如PETR、StreamPETR、PETRv2、MV2d)上,FQ-PETR在W8A8下实现了接近浮点精度的性能(1%退化),同时将延迟降低高达75%,显著优于现有的训练后量化和量化感知训练基线。

关键词

引用

@article{arxiv.2502.15488,
  title  = {FQ-PETR: Fully Quantized Position Embedding Transformation for Multi-View 3D Object Detection},
  author = {Jiangyong Yu and Changyong Shu and Sifan Zhou and Zichen Yu and Xing Hu and Yan Chen and Dawei Yang},
  journal= {arXiv preprint arXiv:2502.15488},
  year   = {2025}
}

备注

This paper is acceptted by AAAI 2026