可分离卷积 LSTM 用于更快的视频分割
计算机视觉与模式识别
2019-07-17 v1 图像与视频处理
摘要
语义分割是自动驾驶汽车等自主机器人的重要模块。与单图像分割相比,视频分割方法的优势在于考虑了时间图像信息,并因此提升了性能。因此,单图像分割方法通过循环单元(如卷积 LSTM (convLSTM) 单元)进行扩展,这些单元被放置在基础网络架构中的合适位置。然而,基于循环神经网络的视频分割方法的主要批评在于其参数量大且计算复杂度高,因此其一视频帧的推理时间比基础版本长达 66% 以上。受空间和可分离深度卷积神经网络成功的启发,我们在本工作中将这些技术推广到 convLSTM,从而显著减少参数量和所需 FLOPs。在不同数据集上的实验表明,使用所提出的改进 convLSTM 单元的分段方法达到了相似或略差的精度,但在 GPU 上比使用标准 convLSTM 单元的方法快达 15%。此外,引入了一种新的评估指标,用于度量分割视频序列中闪烁像素的数量。
引用
@article{arxiv.1907.06876,
title = {Separable Convolutional LSTMs for Faster Video Segmentation},
author = {Andreas Pfeuffer and Klaus Dietmayer},
journal= {arXiv preprint arXiv:1907.06876},
year = {2019}
}