优化 ViViT 训练:面向动作识别的时间与内存削减
计算机视觉与模式识别
2023-06-09 v1
摘要
在本文中,我们针对视频 transformer 所伴随的大量训练时间与内存消耗问题,聚焦于 ViViT(Video Vision Transformer)模型——特别是其 Factorised Encoder(分解编码器)版本——作为动作识别任务的基线。该分解编码器变体采用了许多最先进方法所采用的后期融合(late-fusion)策略。尽管在 ViViT 的各变体中以其良好的速度/精度权衡而脱颖而出,其可观的训练时间与内存需求仍构成了显著的入门壁垒。我们的方法旨在降低这一壁垒,其基于在训练过程中冻结空间 transformer 的思想。若朴素地执行此操作会导致低精度模型。但我们表明,通过(1)恰当地初始化时间 transformer(一个负责处理时间信息的模块),(2)引入一个紧凑的适配器模型,将冻结的空间表示(一个选择性关注输入图像区域的模块)连接到时间 transformer,我们能够在牺牲精度的情况下享受冻结空间 transformer 带来的益处。通过对 6 个基准的广泛实验,我们证明所提出的训练策略显著降低了训练成本(约 50%)与内存消耗,同时与基线模型相比保持或略微提升最高达 1.79% 的性能。我们的方法还额外解锁了在相同内存消耗下使用更大的图像 transformer 模型作为空间 transformer 并访问更多帧的能力。
引用
@article{arxiv.2306.04822,
title = {Optimizing ViViT Training: Time and Memory Reduction for Action Recognition},
author = {Shreyank N Gowda and Anurag Arnab and Jonathan Huang},
journal= {arXiv preprint arXiv:2306.04822},
year = {2023}
}