中文

E-ViLM:基于语义矢量量化分词器的掩码视频建模高效视频-语言模型

计算机视觉与模式识别 2023-11-30 v1

摘要

为构建面向挑战性真实世界任务的可扩展模型,从多样、多模态的数据(如视频、文本和图像)中学习十分重要。在现有工作中,大量研究集中于利用庞大但笨重的跨模态架构。无论其有效性如何,更大的架构不可避免地阻碍模型扩展到真实应用,因此构建轻量级视觉-语言(VL)架构与高效学习方案具有重大实用价值。本文提出一种高效视频-语言模型(称为 E-ViLM)及一种掩码视频建模(MVM)方案,并辅以语义矢量量化分词器。具体而言,我们的 E-ViLM 学习重建被掩码视频区域的语义标签,这些标签由预训练的矢量量化分词器产生,该分词器将连续视觉信号离散化为标签。我们表明,凭借简单的 MVM 任务与常规 VL 预训练建模,我们的 E-ViLM 尽管紧凑,仍能从视频-语言语料中学习具表现力的表征,并很好地泛化至广泛的视频-语言任务,包括视频问答、文本到视频检索等。特别地,我们的 E-ViLM 通过以更快推理速度达到有竞争力的性能而获得明显效率提升,即我们的模型在 MSRVTT 基准上达到 39.339.3% 的 Top-11 准确率,仅用 1515% 参数和少 94.894.8% 的 GFLOPs 便保留了 SOTA 大型 VL 架构 91.491.4% 的准确率。我们还提供了广泛的消融研究,验证了所提 E-ViLM 学习方案的有效性。

关键词

引用

@article{arxiv.2311.17267,
  title  = {E-ViLM: Efficient Video-Language Model via Masked Video Modeling with Semantic Vector-Quantized Tokenizer},
  author = {Jacob Zhiyuan Fang and Skyler Zheng and Vasu Sharma and Robinson Piramuthu},
  journal= {arXiv preprint arXiv:2311.17267},
  year   = {2023}
}