使用合成数据的多模态语义分割
计算机视觉与模式识别
2019-11-01 v1 人工智能
摘要
三维空间(3D)中场景的语义理解是自动驾驶等面向机器人应用的重要组成部分,因为它提供了尺寸、朝向和真实分离距离等几何线索,这些对于做出任务关键决策至关重要。作为第一步,在这项工作中我们研究在缺乏标注的真实世界数据集的情况下,通过学习底层几何上下文以及纹理线索(而非仅纹理线索)来对给定3D场景的不同部分进行语义分类的可能性。为此,我们使用CARLA软件框架生成大量合成场景、其像素级标签及相应的3D表示。然后我们构建了一个深度神经网络,从渲染合成场景的颜色信息中学习特定类别的底层3D表示和纹理线索。进一步我们将学习到的模型应用于不同的真实世界数据集以评估其性能。我们的初步结果表明,该神经网络能够从合成场景中学习几何上下文,并有效地将这一知识应用于对真实世界场景的3D表示中每个点进行分类。
引用
@article{arxiv.1910.13676,
title = {Multi Modal Semantic Segmentation using Synthetic Data},
author = {Kartik Srivastava and Akash Kumar Singh and Guruprasad M. Hegde},
journal= {arXiv preprint arXiv:1910.13676},
year = {2019}
}
备注
Accepted in 3rd Edition of Deep Learning for Automated Driving (DLAD) workshop, IEEE International Conference on Intelligent Transportation Systems (ITSC'19) [see https://sites.google.com/view/dlad-bp-itsc2019/schedule?authuser=0#h.p_gI84BCoB0_bJ]