中文

FQ-PETR:用于多视角3D目标检测的全量化位置嵌入变换

计算机视觉与模式识别 2025-11-17 v2

摘要

基于相机的多视角3D检测是自动驾驶中的关键技术。PETR及其变体(PETRs)在基准测试中表现优异,但面临高计算成本和大内存占用的部署挑战。量化是一种通过降低权重和激活的位宽来压缩深度神经网络的有效技术。然而,直接将现有量化方法应用于PETRs会导致严重的精度下降。该问题主要源于两个关键挑战:(1)多模态特征(具体而言是图像特征和相机-ray位置嵌入,PE)之间的magnitude差异巨大;(2)对非线性算子进行量化的效率低且近似误差大,这些算子通常依赖于不友好的硬件计算。在本文中,我们提出FQ-PETR(Fully Quantized PETR),一种用于PETRs的全量化框架,具有三个关键创新:(1)量化友好的LiDAR-ray位置嵌入(QFPE):用LiDAR先验引导的单点采样取代多点采样,并采用锚框嵌入,消除有问题的非线性(如逆Sigmoid)并将PE尺度与图像特征对齐,从而保持精度。(2)双查找表(DULUT):该算法使用两个级联的线性查找表来逼近复杂的非线性函数,实现高保真且仅需极少条目,无需专用硬件。(3)数值稳定后的量化(QANS):在softmax数值稳定后进行量化,可减轻大输入导致的注意力失真。在PETRs(如PETR、StreamPETR、PETRv2、MV2d)上,FQ-PETR在W8A8下实现了接近浮点精度(仅1%精度下降),同时将延迟降低最高达75%,显著优于现有的PTQ和QAT基线方法。

关键词

引用

@article{arxiv.2511.09347,
  title  = {FQ-PETR: Fully Quantized Position Embedding Transformation for Multi-View 3D Object Detection},
  author = {Jiangyong Yu and Changyong Shu and Sifan Zhou and Zichen Yu and Xing Hu and Yan Chen and Dawei Yang},
  journal= {arXiv preprint arXiv:2511.09347},
  year   = {2025}
}

备注

I made an operational error. I intended to update the paper with Identifier arXiv:2502.15488, not submit a new paper with a different identifier. Therefore, I would like to withdraw the current submission and resubmit an updated version for Identifier arXiv:2502.15488