用于快速视频语义分割的时间分布式网络
计算机视觉与模式识别
2020-04-08 v2 机器学习
多媒体
图像与视频处理
摘要
我们提出了 TDNet,一种为快速且准确的视频语义分割而设计的时间分布式网络。我们观察到,从深度 CNN 某个特定高层提取的特征,可以通过组合从若干较浅子网络提取的特征来近似。利用视频中固有的时间连续性,我们将这些子网络分布在连续帧上。因此,在每个时间步,我们只需执行轻量级计算,从单个子网络中提取一个子特征组。然后,通过应用一个新颖的注意力传播模块来重新组合用于分割的完整特征,该模块补偿了帧间的几何形变。还引入了分组知识蒸馏损失,以进一步提高完整特征和子特征级别的表示能力。在 Cityscapes、CamVid 和 NYUD-v2 上的实验表明,我们的方法以显著更快的速度和更低的延迟达到了 SOTA 精度。
引用
@article{arxiv.2004.01800,
title = {Temporally Distributed Networks for Fast Video Semantic Segmentation},
author = {Ping Hu and Fabian Caba Heilbron and Oliver Wang and Zhe Lin and Stan Sclaroff and Federico Perazzi},
journal= {arXiv preprint arXiv:2004.01800},
year = {2020}
}
备注
[CVPR2020] Project: https://github.com/feinanshan/TDNet