面向语义场景完成的上下文几何感知体素变换器
摘要
基于视觉的语义场景完成 (SSC) 因其在 various 3D perception 任务中的广泛应用而受到广泛关注。现有的稀疏到稠密方法通常会在 various 输入图像上使用共享的 context-independent 查询,无法捕捉不同输入之间的差异,因为 focal 区域随输入而异,导致 cross-attention 的无向特征聚合。此外,缺乏深度信息可能导致投影到图像平面上的点拥有相同的 2D 位置或相似的特征图采样点,从而引发深度歧义。本文提出了一种 context and geometry aware voxel transformer。它利用 context aware query generator 为 individual 输入图像初始化 context-dependent 查询,有效捕获其独特特征并在感兴趣区域内聚合信息。此外,我们将可变形 cross-attention 从 2D 扩展到 3D 像素空间,实现了基于深度坐标对具有相似图像坐标的点进行区分。基于该模块,我们引入了名为 CGFormer 的神经网络,以实现语义场景完成。同时,CGFormer 利用多种 3D 表示 (即 voxel 和 TPV) 从 local 和 global 角度提升变换后 3D 体积的语义和几何表示能力。实验结果表明,CGFormer 在 SemanticKITTI 和 SSCBench-KITTI-360 基准数据集上实现了最先进的性能,分别达到 16.87 和 20.05 的 mIoU,以及 45.99 和 48.07 的 IoU。值得注意的是,CGFormer 甚至超越了使用 temporal images 作为输入或 much larger image backbone 网络的方案。
引用
@article{arxiv.2405.13675,
title = {Context and Geometry Aware Voxel Transformer for Semantic Scene Completion},
author = {Zhu Yu and Runmin Zhang and Jiacheng Ying and Junchen Yu and Xiaohai Hu and Lun Luo and Si-Yuan Cao and Hui-Liang Shen},
journal= {arXiv preprint arXiv:2405.13675},
year = {2024}
}
备注
NIPS 2024 Spotlight