以可靠互作用桥接立体几何与 BEV 表示用于语义场景补全
计算机视觉与模式识别
2024-05-07 v6
摘要
3D 语义场景补全(SSC)是一项病态感知任务,需从有限观测推断密集 3D 场景。先前基于相机的方法因固有几何模糊与观测不完整而难以预测准确语义场景。本文中,我们借助立体匹配技术与鸟瞰图(BEV)表示学习来解决 SSC 中的此类问题。二者互补:立体匹配以对极约束缓解几何模糊,而 BEV 表示以全局语义上下文增强对不可见区域的想象能力。然而,由于立体几何与 BEV 特征间固有表示鸿沟,将其桥接用于 SSC 的密集预测任务并非易事。因此,我们进一步开发了称为 BRGScene 的统一基于占据的框架,其通过密集 3D 体素有效桥接这两种表示以实现可靠语义场景补全。具体而言,我们设计了新颖的互交互集成(MIE)模块用于立体几何与 BEV 特征的像素级可靠聚合。在 MIE 模块内,采用带置信度重加权的双向可靠交互(BRI)模块通过互引导促进细粒度交互。此外,引入双体素集成(DVE)模块通过通道重标定与多组投票促进互补聚合。我们的方法在 SemanticKITTI 上超越所有已发表的基于相机的方法。代码见 https://github.com/Arlo0o/StereoScene。
引用
@article{arxiv.2303.13959,
title = {Bridging Stereo Geometry and BEV Representation with Reliable Mutual Interaction for Semantic Scene Completion},
author = {Bohan Li and Yasheng Sun and Zhujin Liang and Dalong Du and Zhuanghui Zhang and Xiaofeng Wang and Yunnan Wang and Xin Jin and Wenjun Zeng},
journal= {arXiv preprint arXiv:2303.13959},
year = {2024}
}
备注
IJCAI2024 (https://github.com/Arlo0o/StereoScene)