中文

深度语义分割三重综述:面向效率、时序与深度感知的设计

计算机视觉与模式识别 2023-03-09 v1 人工智能

摘要

语义图像与视频分割是当今计算机视觉中最重要的任务之一,因为它们通过对给定场景中像素的密集分类,提供了对环境的完整且有意义的表示。近年来,深度学习,更确切地说是卷积神经网络(Convolutional Neural Networks),将语义分割的性能与泛化能力推向了新的高度。然而,设计深度语义分割模型是一项复杂的任务,因为它可能涉及依赖于应用的方面。特别是在考虑自动驾驶应用时,应权衡鲁棒性与效率的折衷,以及内在限制——计算/内存边界与数据稀缺——和约束——实时推理。在这方面,使用额外的数据模态,例如用于推理场景几何的深度感知,以及来自视频的时间线索以探索冗余与一致性,是有前景的方向,但在文献中尚未被充分挖掘其潜力。本文从三个不同视角对自动驾驶视觉背景下深度语义分割中最相关且最新的进展进行综述:面向实时操作的效率导向模型开发、RGB-深度数据融合(RGB-D语义分割),以及时序感知模型中对视频时间信息的利用。我们的主要目标是就各视角所面临的主要方法、优势、局限、结果与挑战提供全面讨论,使读者不仅能入门,还能了解这一令人振奋且富有挑战的研究领域的最新进展。

关键词

引用

@article{arxiv.2303.04315,
  title  = {A Threefold Review on Deep Semantic Segmentation: Efficiency-oriented, Temporal and Depth-aware design},
  author = {Felipe Manfio Barbosa and Fernando Santos Osório},
  journal= {arXiv preprint arXiv:2303.04315},
  year   = {2023}
}