中文

释放语义场景完成的网络潜能

计算机视觉与模式识别 2024-03-15 v2

摘要

语义场景完成(SSC)旨在从单视图RGB-D图像预测完整的3D体素占据和语义,近期的SSC方法通常采用多模态输入。然而,我们的调查发现两个局限性:来自单一模态的特征学习效果不佳,以及对有限数据集的过拟合。为解决这些问题,本文提出了一种新颖的SSC框架——对抗性模态调制网络(AMMNet),其视角是优化梯度更新。 proposed AMMNet引入了两个核心模块:一种实现模态之间梯度流相互依存的跨模态调制,以及一种利用动态梯度竞争的定制化对抗训练方案。具体而言,跨模态调制会自适应地重新校准特征,以更好地激发来自每个单一模态的表示潜能。对抗训练采用演化梯度的对抗性博弈,采用定制化指导以强化生成器对视觉保真度的感知,包括几何完整性和语义正确性。广泛的实验结果表明,AMMNet在与最先进的SSC方法之间取得显著优势,为提高SSC方法的有效性和泛化性提供了有前景的方向。

关键词

引用

@article{arxiv.2403.07560,
  title  = {Unleashing Network Potentials for Semantic Scene Completion},
  author = {Fengyun Wang and Qianru Sun and Dong Zhang and Jinhui Tang},
  journal= {arXiv preprint arXiv:2403.07560},
  year   = {2024}
}

备注

accepted by CVPR2024