中文

基于类间适应的三维场景解析

计算机视觉与模式识别 2019-03-04 v2

摘要

我们提出一种仅使用计算机图形学数据集来解析真实世界三维场景的方法。基于语义分割的三维场景解析需要实现虚拟世界中的类别交互。卷积神经网络(CNNs)近期在包括语义分割在内的计算机视觉任务上展现出最优性能。然而,训练CNNs需要收集并标注大量数据。尤其在语义分割中,逐像素标注耗时巨大且易出错。相比之下,计算机图形学可生成大量精确标注数据,并能通过更改相机位姿、纹理与光照轻松扩展。尽管有这些优势,在计算机图形学数据集上训练的模型在真实数据上表现不佳,即已知的域偏移问题。为解决该问题,我们首先指出深度模态与合成噪声可有效减小域偏移。随后,我们提出类间适应方法以获取CNNs的域不变特征。为减小域偏移,我们构建了含大量道具的计算机图形学房间,并提供照片级真实感渲染图像。我们还展示了将语义分割与同步定位与地图构建(SLAM)相结合的应用,该应用在实际房间中实时完成精确的三维场景解析。

关键词

引用

@article{arxiv.1812.03622,
  title  = {3D Scene Parsing via Class-Wise Adaptation},
  author = {Daichi Ono and Hiroyuki Yabe and Tsutomu Horikawa},
  journal= {arXiv preprint arXiv:1812.03622},
  year   = {2019}
}