语义 RGB-D 图像合成
计算机视觉与模式识别
2023-09-20 v2 人工智能
摘要
为 RGB-D 语义图像分割收集多样化的训练图像集并非总是可行。特别是当机器人需在如家庭等隐私敏感区域操作时,收集往往局限于少量地点。因此,标注图像缺乏外观多样性,且 RGB-D 语义图像分割方法易于过拟合训练数据。本文由此引入语义 RGB-D 图像合成以解决该问题。它要求为给定语义标签图合成一幅外观逼真的 RGB-D 图像。然而,当前方法为单模态,无法处理多模态数据。事实上,我们表明将单模态方法扩展至多模态数据表现不佳。因此,本文提出一种面向多模态数据的生成器,将语义布局的模态无关信息分别与生成 RGB 图像和深度图像所需的模态相关信息分离。此外,我们提出一种判别器,以确保标签图与生成图像间的语义一致性,以及真实与生成图像间的感知相似性。我们全面的实验表明,所提方法大幅优于先前的单模态方法,且通过在训练中混合真实与生成图像,RGB-D 语义分割方法的精度可得显著提升。
引用
@article{arxiv.2308.11356,
title = {Semantic RGB-D Image Synthesis},
author = {Shijie Li and Rong Li and Juergen Gall},
journal= {arXiv preprint arXiv:2308.11356},
year = {2023}
}
备注
ICCV Workshop on Representation Learning with Very Limited Images 2023