中文

S3-Net:一种基于单次分割的快速轻量视频场景理解网络

计算机视觉与模式识别 2020-11-05 v1

摘要

视频的实时理解在自动驾驶等多种 AI 应用中至关重要。本文提出一种用于视频场景理解的快速单次分割策略。所提出的网络称为 S3-Net,可快速定位并分割目标子场景,同时提取结构化时间序列语义特征作为基于 LSTM 的时空模型的输入。利用张量化与量化技术,S3-Net 旨在成为适用于边缘计算的轻量网络。使用 CityScapes、UCF11、HMDB51 和 MOMENTS 数据集的实验表明,所提出的 S3-Net 在 UCF11 上相较基于 3D-CNN 的方法准确率提升 8.1%,在 GTX1080Ti GPU 上对 CityScapes 的存储减少 6.9 倍且推理速度达 22.8 FPS。

关键词

引用

@article{arxiv.2011.02265,
  title  = {S3-Net: A Fast and Lightweight Video Scene Understanding Network by Single-shot Segmentation},
  author = {Yuan Cheng and Yuchao Yang and Hai-Bao Chen and Ngai Wong and Hao Yu},
  journal= {arXiv preprint arXiv:2011.02265},
  year   = {2020}
}

备注

WACV2021