中文

用于视频分类的迁移学习:多域上的 Video Swin Transformer

计算机视觉与模式识别 2025-04-01 v2 人工智能 计算与语言

摘要

计算机视觉界已看到从基于卷积的架构向纯 transformer 架构在图像与视频任务上的转变。从这些任务零开始训练 transformer 通常需要大量数据与计算资源。Video Swin Transformer(VST)是为视频分类开发的纯 transformer 模型,在多个数据集上取得了精度与效率的 SOTA 结果。本文旨在理解 VST 是否具备足够泛化能力以用于域外设置。我们采用从 Kinetics-400 迁移学习的方法,在两个大规模数据集 FCVID 与 Something-Something 上研究 VST 的性能,该方法所需内存约为从头训练的四分之一。我们随后拆解结果以理解 VST 在何处失败最多,以及迁移学习方法在哪些场景下可行。我们的实验在 FCVID 上取得了 85% 的 top-1 精度而无需重训整个模型,等于该数据集的 SOTA,在 Something-Something 上精度为 21%。实验还表明,当视频时长增加时 VST 性能平均下降,这似乎是模型设计选择的结果。由结果我们得出结论:当目标类别与训练所用类别类型相同时,VST 无需重训即可足够好地泛化分类域外视频。我们在从 Kinetics-400 到 FCVID 的迁移学习中观察到此效应,两者数据集主要目标均为物体。另一方面,若类别类型不同,则迁移学习后的精度预期较差。我们在从 Kinetics-400(类别主要为物体)到 Something-Something(类别主要为动作)的迁移学习中观察到此效应。

关键词

引用

@article{arxiv.2210.09969,
  title  = {Transfer-learning for video classification: Video Swin Transformer on multiple domains},
  author = {Daniel A. P. Oliveira and David Martins de Matos},
  journal= {arXiv preprint arXiv:2210.09969},
  year   = {2025}
}

备注

7 pages, 11 figures