Accel:一种用于视频高效语义分割的校正融合网络
计算机视觉与模式识别
2019-07-09 v4 机器学习
摘要
我们提出 Accel,一种新颖的语义视频分割系统,它通过融合两个网络分支的预测,在低推理成本下实现高精度:(1)一个参考分支,在参考关键帧上提取高细节特征,并利用帧间光流估计将这些特征向前扭曲;(2)一个更新分支,在当前帧上计算可调质量的特征,在每一视频帧执行时间更新。更新分支的模块化——可插入不同层深的子网络(如 ResNet-18 至 ResNet-101)——使其能在一种全新的、最先进的精度-吞吐量权衡区间上运行。在此曲线上,Accel 模型相比最接近的同类单帧分割网络实现了更高精度与更快推理时间。总体而言,Accel 在高效语义视频分割上显著优于先前工作,校正了在具有复杂动态的数据集上累积的扭曲相关误差。Accel 端到端可训练且高度模块化:参考网络、光流网络与更新网络可各自独立选取,依应用需求而定,随后联合微调。其结果是一个稳健、通用的快速高精度视频语义分割系统。
引用
@article{arxiv.1807.06667,
title = {Accel: A Corrective Fusion Network for Efficient Semantic Segmentation on Video},
author = {Samvit Jain and Xin Wang and Joseph Gonzalez},
journal= {arXiv preprint arXiv:1807.06667},
year = {2019}
}
备注
CVPR 2019 (oral)