中文

UVid-Net:通过嵌入时间信息增强无人机航拍视频的语义分割

计算机视觉与模式识别 2021-05-28 v2

摘要

航拍视频的语义分割已广泛用于环境监测变化、城市规划与灾害管理中的决策。这些决策支持系统的可靠性取决于视频语义分割算法的精度。现有的基于 CNN 的视频语义分割方法通过引入如 LSTM 或光流等额外模块来计算视频的时间动态,从而增强了图像语义分割方法,但这带来了计算开销。本研究通过融入时间信息来改进 CNN 架构,以提升视频语义分割的效率。本文提出一种基于编码器-解码器增强的 CNN 架构(UVid-Net)用于无人机视频语义分割。所提架构的编码器嵌入时间信息以实现时间一致的标注;解码器通过引入特征细化模块得到增强,有助于类别标签的准确定位。所提出的 UVid-Net 架构在扩展的 ManipalUAVid 数据集上进行了定量评估,观测到 mIoU 性能度量达 0.79,显著优于其他 SOTA 算法。此外,即使在城市场景街景上预训练的 UVid-Net 模型,仅对最终层在无人机航拍视频上微调,也产生了有前景的结果。

关键词

引用

@article{arxiv.2011.14284,
  title  = {UVid-Net: Enhanced Semantic Segmentation of UAV Aerial Videos by Embedding Temporal Information},
  author = {Girisha S and Ujjwal Verma and Manohara Pai M M and Radhika Pai},
  journal= {arXiv preprint arXiv:2011.14284},
  year   = {2021}
}

备注

Includes additional discussions/results and comparison with SOTA methods. Published in IEEE JSTARS