中文

TapLab:一种利用压缩域知识实现语义视频分割的快速框架

计算机视觉与模式识别 2020-08-19 v3

摘要

实时语义视频分割是一项具有挑战性的任务,因为对推理速度有严格要求。近期的方法主要致力于减小模型规模以实现高效率。在本文中,我们从不同视角重新思考该问题:利用压缩视频中包含的知识。我们提出了一个简单而有效的框架,称为 TapLab,以利用来自压缩域的资源。具体而言,我们设计了一个使用运动向量的快速特征扭曲模块用于加速。为减少运动向量引入的噪声,我们设计了一个残差引导校正模块和一个使用残差的残差引导帧选择模块。TapLab 显著减少了最先进的快速语义图像分割模型的冗余计算,以可控的精度下降实现 3 到 10 倍的加速。实验结果表明,TapLab 在 Cityscapes 数据集上以单块 GPU 卡处理 1024x2048 视频时,在 99.8 FPS 下达到 70.6% mIoU。一个高速版本甚至达到 160+ FPS 的速度。代码将很快在 https://github.com/Sixkplus/TapLab 提供。

关键词

引用

@article{arxiv.2003.13260,
  title  = {TapLab: A Fast Framework for Semantic Video Segmentation Tapping into Compressed-Domain Knowledge},
  author = {Junyi Feng and Songyuan Li and Xi Li and Fei Wu and Qi Tian and Ming-Hsuan Yang and Haibin Ling},
  journal= {arXiv preprint arXiv:2003.13260},
  year   = {2020}
}

备注

Accepted to TPAMI