IMENet:通过迭代互增强联合实现3D语义场景补全与2D语义分割
计算机视觉与模式识别
2021-06-30 v1
摘要
3D语义场景补全与2D语义分割是两个紧密关联且对室内场景理解均至关重要的任务,因为它们预测相同的语义类别,并使用正相关的上层特征。现有方法利用从早期融合的RGB-D图像中提取的2D特征进行2D分割以改进3D场景补全。我们认为这种顺序方案不能确保两个任务充分互益,并提出迭代互增强网络(IMENet)联合求解二者,在预测后期阶段交互式精炼两项任务。具体而言,在一个统一框架下为两个任务开发了两种精炼模块。其一是2D可变形上下文金字塔(DCP)模块,它接收当前3D预测的投影以精炼2D预测。反过来,提出3D可变形深度注意力(DDA)模块,利用2D预测的再投影结果更新粗粒度3D预测。这种迭代融合发生在两个任务稳定的后期高层特征上。在NYU和NYUCAD数据集上的大量实验验证了所提迭代后期融合方案的有效性,且我们的方法在3D语义场景补全和2D语义分割上均优于当前最优方法(SOTA)。
引用
@article{arxiv.2106.15413,
title = {IMENet: Joint 3D Semantic Scene Completion and 2D Semantic Segmentation through Iterative Mutual Enhancement},
author = {Jie Li and Laiyan Ding and Rui Huang},
journal= {arXiv preprint arXiv:2106.15413},
year = {2021}
}
备注
Accepted by IJCAI 2021