文本引导视频掩码自编码器
计算机视觉与模式识别
2024-08-02 v1
摘要
近期的视频掩码自编码器(MAE)工作设计了改进的掩码算法,专注于显著性区域。这些工作利用视觉线索(如运动)来掩码最显著的区域。然而,此类视觉线索的鲁棒性取决于输入视频与底层假设的匹配程度。另一方面,自然语言描述是视频的一种信息密集表示,它隐式地捕获了显著性,而无需模态特定的假设,但尚未在视频 MAE 中被探索。为此,我们提出了一种新颖的文本引导掩码算法(TGM),它掩码与配对字幕对应度最高的视频区域。在不利用任何显式视觉线索作为显著性信号的情况下,我们的 TGM 在性能上与运动引导掩码等最先进的掩码算法具有竞争力。为了进一步从自然语言的语义中受益以进行掩码重建,我们接下来提出了一种统一框架,将 MAE 和掩码视频-文本对比学习相结合。我们证明,在现有的各种掩码算法中,将 MAE 和掩码视频-文本对比学习相统一,可以在多种视频识别任务上提升下游性能,尤其是在线性探针方面。在这一统一框架中,我们的 TGM 在五个动作识别数据集和一个自我中心数据集上取得了最佳的相对性能,突显了自然语言在掩码视频建模中的互补性质。
引用
@article{arxiv.2408.00759,
title = {Text-Guided Video Masked Autoencoder},
author = {David Fan and Jue Wang and Shuai Liao and Zhikang Zhang and Vimal Bhat and Xinyu Li},
journal= {arXiv preprint arXiv:2408.00759},
year = {2024}
}
备注
Accepted to ECCV 2024