QD-BEV:面向多视角三维目标检测的量化感知视图引导蒸馏
计算机视觉与模式识别
2023-08-22 v1
摘要
基于 BEV(鸟瞰图)的多视角三维检测近来取得了显著进展。然而,最先进模型的巨大内存消耗使其难以部署在车辆上,且不可忽略的延迟会影响流式应用的实时感知。尽管量化已被广泛应用以轻量化模型,我们在文中表明,直接在 BEV 任务中应用量化会 1)使训练不稳定,以及 2)导致不可容忍的性能退化。为解决这些问题,我们的方法 QD-BEV 提出了一种新颖的视图引导蒸馏(VGD)目标,它能在利用图像特征和 BEV 特征的同时稳定量化感知训练(QAT)并提升模型性能。我们的实验表明,QD-BEV 以显著的效率增益取得了与先前方法相似甚至更优的精度。在 nuScenes 数据集上,4 位权重量化和 6 位激活量化的 QD-BEV-Tiny 模型以仅 15.8 MB 的模型大小取得了 37.2% 的 NDS,以 8 倍模型压缩率超越 BevFormer-Tiny 达 1.8%。在 Small 和 Base 变体上,QD-BEV 模型同样表现优异,分别取得 47.9% NDS(28.2 MB)和 50.9% NDS(32.9 MB)。
引用
@article{arxiv.2308.10515,
title = {QD-BEV : Quantization-aware View-guided Distillation for Multi-view 3D Object Detection},
author = {Yifan Zhang and Zhen Dong and Huanrui Yang and Ming Lu and Cheng-Ching Tseng and Yuan Du and Kurt Keutzer and Li Du and Shanghang Zhang},
journal= {arXiv preprint arXiv:2308.10515},
year = {2023}
}
备注
ICCV 2023 Accept