VIOLET:基于掩码视觉标记建模的端到端视频-语言Transformer
计算机视觉与模式识别
2022-04-19 v2
摘要
视频-语言(VidL)建模的一个重大挑战在于,从图像/视频理解模型中提取的固定视频表示与下游VidL数据之间存在脱节。近期的研究尝试通过端到端训练来缓解这种脱节。为了使其在计算上可行,先前的工作倾向于将视频输入“图像化”,即,将少量稀疏采样的帧输入2D CNN,然后通过简单的平均池化或拼接来获得整体视频表示。尽管取得了有希望的结果,但这种简单方法可能会丢失对执行下游VidL任务至关重要的时间信息。在这项工作中,我们提出了VIOLET,一个完全端到端的VIdeO-LanguagE Transformer,它采用视频Transformer来显式建模视频输入的时间动态。此外,与先前研究发现针对视频输入的预训练任务(例如,掩码帧建模)效果不佳不同,我们设计了一个新的预训练任务——掩码视觉标记建模(MVM),以实现更好的视频建模。具体来说,原始视频帧块被“标记化”为离散的视觉标记,其目标是根据被掩码的块来恢复原始的视觉标记。综合分析证明了通过视频Transformer进行显式时间建模和MVM的有效性。因此,VIOLET在5个视频问答任务和4个文本到视频检索任务上均达到了新的最先进性能。
引用
@article{arxiv.2111.12681,
title = {VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling},
author = {Tsu-Jui Fu and Linjie Li and Zhe Gan and Kevin Lin and William Yang Wang and Lijuan Wang and Zicheng Liu},
journal= {arXiv preprint arXiv:2111.12681},
year = {2022}
}
备注
Code is available at https://github.com/tsujuifu/pytorch_violet