理解用于分割的视频 Transformer:应用与可解释性综述
计算机视觉与模式识别
2023-10-20 v1
摘要
视频分割涵盖广泛的问题建模类别,例如对象、场景、行为者-动作以及多模态视频分割,旨在通过像素级掩码描绘特定任务场景成分。近来,该研究领域的方法从集中于基于 ConvNet 的模型转向基于 transformer 的模型。此外,受对基础科学理解、模型诊断与现实部署社会影响的日益关注推动,出现了多种针对 transformer 模型与视频时间动力的可解释性方法。以往的综述主要聚焦于在视频分割任务子集上的 ConvNet 模型或用于分类任务的 transformer。此外,基于 transformer 的视频分割模型的组件级讨论尚未得到应有重视。并且,先前对可解释性方法的回顾聚焦于用于分类的 transformer,而对视频模型时间动力建模能力的分析较少受到关注。在本综述中,我们通过深入探讨各类视频分割、对最先进基于 transformer 的模型进行组件级讨论,以及回顾相关可解释性方法来解决上述问题。我们首先介绍不同的视频分割任务类别、其目标、特定挑战与基准数据集。接着,我们对近期基于 transformer 的模型进行组件级回顾,并记录在不同视频分割任务上的最优水平。随后,我们讨论针对 transformer 模型的事后与事前可解释性方法,以及用于理解视频模型中时间维度作用的可解释性方法。最后,我们以未来研究方向作结。
引用
@article{arxiv.2310.12296,
title = {Understanding Video Transformers for Segmentation: A Survey of Application and Interpretability},
author = {Rezaul Karim and Richard P. Wildes},
journal= {arXiv preprint arXiv:2310.12296},
year = {2023}
}