基于注意力的多模态融合网络用于语义场景补全
计算机视觉与模式识别
2020-04-17 v2
摘要
本文提出一种端到端的 3D 卷积网络,称为基于注意力的多模态融合网络(AMFNet),用于从单视图 RGB-D 图像推断体积化 3D 场景的占据情况和语义标签的语义场景补全(SSC)任务。与使用仅从 RGB-D 图像提取的语义特征的先前方法相比,所提出的 AMFNet 通过学习利用从 RGB-D 图像推断 2D 语义分割的经验以及空间维度中可靠的深度线索,同时执行有效的 3D 场景补全和语义分割。这是通过采用由 2D 语义分割增强的多模态融合架构以及由残差注意力块赋能的 3D 语义补全网络来实现的。我们在合成 SUNCG-RGBD 数据集和真实 NYUv2 数据集上验证了我们的方法,结果表明,与最先进的方法相比,我们的方法在合成 SUNCG-RGBD 数据集和真实 NYUv2 数据集上分别取得了 2.5% 和 2.6% 的提升。
引用
@article{arxiv.2003.13910,
title = {Attention-based Multi-modal Fusion Network for Semantic Scene Completion},
author = {Siqi Li and Changqing Zou and Yipeng Li and Xibin Zhao and Yue Gao},
journal= {arXiv preprint arXiv:2003.13910},
year = {2020}
}
备注
Accepted by AAAI 2020