利用VLM辅助训练增强用于动作理解的视频Transformer
计算机视觉与模式识别
2024-03-26 v1
摘要
凭借其提取相关时空视频嵌入的能力,Vision Transformers(ViTs)目前是视频动作理解中性能最佳的模型。然而,它们在跨领域或数据集上的泛化能力有些有限。相比之下,视觉语言模型(VLMs)展现出了卓越的泛化性能,但目前无法处理视频。因此,它们无法提取对动作理解至关重要的时空模式。在本文中,我们提出了四层提示(FTP)框架,利用ViTs和VLMs互补的优势。我们保留了ViTs强大的时空表示能力,但通过将其与VLM输出对齐,改进了视觉编码,使其更加全面和通用。FTP框架增加了四个特征处理器,分别关注视频中人类动作的特定方面:动作类别、动作组成部分、动作描述和上下文信息。VLM仅在训练期间使用,推理时产生的计算成本极小。我们的方法持续取得SOTA性能。例如,我们在Kinetics-400上达到了93.8%的显著Top-1准确率,在Something-Something V2上达到了83.4%,分别超过了VideoMAEv2 2.8%和2.6%。
关键词
引用
@article{arxiv.2403.16128,
title = {Enhancing Video Transformers for Action Understanding with VLM-aided Training},
author = {Hui Lu and Hu Jian and Ronald Poppe and Albert Ali Salah},
journal= {arXiv preprint arXiv:2403.16128},
year = {2024}
}