面向非静态相机鲁棒运动分割的深度学习
计算机视觉与模式识别
2021-02-23 v1
摘要
本工作提出了一种基于端到端 DCNN 的新的运动分割方法,尤其针对由此类非静态相机捕获的视频序列,称为 MOSNET。其他方法有仅关注空间或时间上下文,而所提方法使用 3D 卷积作为关键技术,以在连贯的视频帧中纳入时空特征。这是通过以低抽象层次和高抽象层次在特征中捕获时间信息来实现的。该精简网络架构约含 21k 可训练参数,主要基于预训练的 VGG-16 网络。MOSNET 使用了一种新的特征图融合技术,使网络能够针对输入聚焦于适当的抽象层次、分辨率以及感受野的适当大小。此外,该端到端基于深度学习的方法可通过基于特征的图像对齐作为预处理步骤来扩展,这为某些场景带来性能提升。以场景无关的方式评估端到端基于深度学习的 MOSNET 网络,在 CDNet2014 数据集上取得了 0.803 的总体 F-measure。使用五帧输入的小时序窗口,无需任何初始化即可获得该结果。因此,该网络能够在由非静态相机捕获、图像内容在场景中显著变化的场景上表现良好。为在非静态相机捕获的场景中获得鲁棒结果,基于特征的图像对齐可作为预处理步骤实现。结合预处理的 MOSNET 在跨评估使用重新标注的 LASIESTA 数据集时取得了 0.685 的 F-measure,这印证了 MOSNET 的泛化能力。
引用
@article{arxiv.2102.10929,
title = {Deep Learning for Robust Motion Segmentation with Non-Static Cameras},
author = {Markus Bosch},
journal= {arXiv preprint arXiv:2102.10929},
year = {2021}
}