CVSformer:面向语义场景补全的跨视角合成 Transformer
计算机视觉与模式识别
2023-07-18 v1
摘要
语义场景补全(SSC)需准确理解 3D 场景中各物体间的几何与语义关系,以推理被遮挡物体。主流 SSC 方法对 3D 物体进行体素化,使深度 3D 卷积网络(3D CNN)从复杂场景中学习物体关系。然而,当前网络缺乏可控制核来建模跨多视角的物体关系,而恰当视角可提供相关信息以提示被遮挡物体的存在。本文提出跨视角合成 Transformer(CVSformer),由多视角特征合成与跨视角 Transformer 组成,用于学习跨视角物体关系。在多视角特征合成中,我们使用一组以不同方式旋转的 3D 卷积核,为每个体素计算多视角特征。在跨视角 Transformer 中,我们采用跨视角融合全面学习跨视角关系,形成增强各视角特征的有用信息。我们利用增强后特征预测所有体素的几何占据与语义标签。我们在公开数据集上评估 CVSformer,其取得了 SOTA 结果。
引用
@article{arxiv.2307.07938,
title = {CVSformer: Cross-View Synthesis Transformer for Semantic Scene Completion},
author = {Haotian Dong and Enhui Ma and Lubo Wang and Miaohui Wang and Wuyuan Xie and Qing Guo and Ping Li and Lingyu Liang and Kairui Yang and Di Lin},
journal= {arXiv preprint arXiv:2307.07938},
year = {2023}
}
备注
10 pages, 6 figures