MUSTAN:多尺度时间上下文作为注意力机制的鲁棒视频前景分割
计算机视觉与模式识别
2024-02-05 v1 人工智能
摘要
视频前景分割(VFS)是一项重要的计算机视觉任务,旨在从背景中分割出运动中的物体。目前大多数方法基于图像,即仅依赖空间线索而忽略运动线索,因此容易过拟合训练数据,对域外(OOD)分布泛化不佳。为解决上述问题,先前的工作利用了光流、背景减除掩码等多种线索。然而,拥有光流等标注的视频数据是一项具有挑战性的任务。本文利用视频数据中的时间信息和空间线索来提升OOD性能。然而,挑战在于如何以可解释的方式对视频数据中的时间信息进行建模,这会产生显著差异。因此,我们设计了一种策略,将视频的时间上下文整合到VFS的开发中。我们的方法产生了深度学习架构,即MUSTAN1和MUSTAN2,它们基于多尺度时间上下文作为注意力的思想,有助于模型学习对VFS有益的更优表示。此外,我们引入了一个新的视频数据集,即室内监控数据集(ISD),用于VFS。该数据集在帧级别具有多种标注,如前景二值掩码、深度图和实例语义标注。因此,ISD可以惠及其他计算机视觉任务。我们验证了架构的有效性,并与基线进行了性能比较。我们证明所提出的方法在OOD上显著优于基准方法。此外,由于ISD,MUSTAN2在OOD数据的某些视频类别上性能显著提升。
引用
@article{arxiv.2402.00918,
title = {MUSTAN: Multi-scale Temporal Context as Attention for Robust Video Foreground Segmentation},
author = {Praveen Kumar Pokala and Jaya Sai Kiran Patibandla and Naveen Kumar Pandey and Balakrishna Reddy Pailla},
journal= {arXiv preprint arXiv:2402.00918},
year = {2024}
}
备注
10 pages, 8 figures