SToRe3D:用于高效多视角 3D 目标检测的 ViT 稀疏 Token 相关性
计算机视觉与模式识别
2026-05-15 v1 机器人学
摘要
Vision Transformer (ViT) 能够实现强大的多视角 3D 检测,但由于在多个视角和大型 3D 区域中进行密集 token 和查询处理,其推理延迟较高。现有的稀疏性方法主要为 2D 视觉设计,它们修剪或合并图像 token,但无法扩展到全模型稀疏性或处理 3D 目标查询。我们引入了 SToRe3D,这是一个相关性对齐的稀疏性框架,它联合选择 2D 图像 token 和 3D 目标查询,同时存储过滤后的特征以供重新激活。相互的 2D-3D 相关性头将计算资源分配给驾驶关键内容,并保留其他嵌入。在 nuScenes 和我们新建的 nuScenes-Relevance 基准上进行评估,SToRe3D 实现了最高 3 倍的推理加速,且精度损失微乎其微,从而确立了实时的大规模基于 ViT 的 3D 检测,同时保持了对规划关键智能体的准确性。
引用
@article{arxiv.2605.14110,
title = {SToRe3D: Sparse Token Relevance in ViTs for Efficient Multi-View 3D Object Detection},
author = {Sandro Papais and Lezhou Feng and Charles Cossette and Lingting Ge},
journal= {arXiv preprint arXiv:2605.14110},
year = {2026}
}
备注
Accepted to CVPR 2026