基于稀疏原型的 Transformer 用于相机-based 3D 占用预测:SPOT-Occ
计算机视觉与模式识别
2026-02-05 v1 机器学习
机器人学
摘要
实现从相机获取高度精确且实时的 3D 占用预测是确保自动驾驶车辆安全可靠部署的关键要求。虽然这种向稀疏 3D 表示的转变解决了编码瓶颈,但为解码器引入了新挑战:如何高效地聚合来自稀疏且非均匀分布的体素特征,而不依赖计算昂贵的稠密注意力。在本文中,我们提出一种新颖的基于原型的稀疏 Transformer 解码器,取代昂贵的交互过程,通过引导特征选择和聚焦聚合两个阶段实现高效处理。我们的核心思想是使解码器的注意力原型导向。我们通过稀疏原型选择机制实现这一点,其中每个查询自适应地识别一组最显著的体素特征,称为原型,以进行聚焦特征聚合。为确保这种动态选择稳定有效,我们引入一种互补去噪范式。该方法利用真实掩码提供显式指导,确保解码器层之间查询-原型关联的一致性。我们设计的模型称为 SPOT-Occ,在速度上显著优于先前方法,同时也提升了准确性。源代码已发布于 https://github.com/chensuzeyu/SpotOcc。
引用
@article{arxiv.2602.04240,
title = {SPOT-Occ: Sparse Prototype-guided Transformer for Camera-based 3D Occupancy Prediction},
author = {Suzeyu Chen and Leheng Li and Ying-Cong Chen},
journal= {arXiv preprint arXiv:2602.04240},
year = {2026}
}
备注
8 pages, 6 figures