中文

ET-Former:基于单摄像机的3D语义场景完成的高效三轴可变形注意力

计算机视觉与模式识别 2025-03-04 v2

摘要

我们提出ET-Former,一款 novel的端到端算法,用于单摄像机下的语义场景完成。该方法从单一RGB观测生成语义占据图,同时提供语义预测的不确定性估计。通过设计基于三轴的可变形注意力机制,我们的方法在几何理解方面优于其他SOTA方法,并降低语义预测中的噪声。此外,利用条件变分自编码器(CVAE),我们估计了这些预测的不确定性。生成的语义和不确定性图将有助于制定促进安全合规决策的导航策略。评估语义KITTI数据集时,ET-Former在Intersection over Union (IoU)和mean IoU (mIoU)方面取得最高分数,同时保持最低的GPU内存占用,超越了state-of-the-art (SOTA)方法。在SemanticKITTI测试集上,ET-Former将IoU从44.71提高到51.49,mIoU从15.04提高到16.30,训练内存消耗仅为10.9 GB。项目页面:https://github.com/jingGM/ET-Former.git。

关键词

引用

@article{arxiv.2410.11019,
  title  = {ET-Former: Efficient Triplane Deformable Attention for 3D Semantic Scene Completion From Monocular Camera},
  author = {Jing Liang and He Yin and Xuewei Qi and Jong Jin Park and Min Sun and Rajasimman Madhivanan and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2410.11019},
  year   = {2025}
}