通过令牌压缩加速基于 ViT 的多视图 3D 检测器
计算机视觉与模式识别
2024-09-04 v1
摘要
缓慢的推理速度是将多视图 3D 检测器部署到自动驾驶等具有高实时性要求的任务中最关键的问题之一。尽管许多基于稀疏查询的方法已经尝试提高 3D 检测器的效率,但它们忽略了考虑骨干网络,尤其是在使用视觉 Transformer(ViT)以获得更好性能时。为了解决这个问题,我们通过令牌压缩探索了用于多视图 3D 检测的高效 ViT 骨干网络,并提出了一种简单而有效的方法,称为 TokenCompression3D(ToC3D)。通过利用历史对象查询作为高质量的前景先验,对其中的 3D 运动信息进行建模,并通过注意力机制将它们与图像令牌交互,ToC3D 能够有效地确定图像令牌的信息密度大小,并分割出显著的前景令牌。借助引入的动态路由器设计,ToC3D 可以将更多计算资源分配给重要的前景令牌,同时压缩信息损失,从而实现更高效的基于 ViT 的多视图 3D 检测器。在大规模 nuScenes 数据集上的大量结果表明,我们的方法在推理速度提升高达 30% 的情况下,几乎可以保持近期 SOTA 的性能,并且在扩展 ViT 和输入分辨率后,这种改进是一致的。代码将发布在 https://github.com/DYZhang09/ToC3D。
引用
@article{arxiv.2409.00633,
title = {Make Your ViT-based Multi-view 3D Detectors Faster via Token Compression},
author = {Dingyuan Zhang and Dingkang Liang and Zichang Tan and Xiaoqing Ye and Cheng Zhang and Jingdong Wang and Xiang Bai},
journal= {arXiv preprint arXiv:2409.00633},
year = {2024}
}
备注
Accepted by ECCV 2024