中文

VidLA:大规模视频-语言对齐

计算机视觉与模式识别 2024-03-25 v1 计算与语言 机器学习

摘要

在本文中,我们提出了一种大规模视频-语言对齐方法 VidLA。以往的视频-语言对齐方法存在两个主要局限性。首先,它们未能同时捕获短程和长程时间依赖关系,且通常采用难以与现有预训练图像-文本基础模型集成的复杂分层深度网络架构。为了有效解决这一局限性,我们转而保持网络架构简单,并使用一组以分层方式在不同时间分辨率上运行的数据 token,以适应视频在时间上的分层特性。通过采用简单的双塔架构,我们能够利用预训练的图像-文本基础模型初始化我们的视频-语言模型,从而提升最终性能。其次,由于缺乏语义对齐的大规模训练数据,现有的视频-语言对齐工作面临困难。为了克服这一问题,我们利用最新的 LLM 策划了迄今为止最大、具有更好视觉基础的视频-语言数据集。此外,与仅包含短片段的现有视频-文本数据集不同,我们的数据集丰富了不同时长的视频片段,以辅助我们的时间分层数据 token 在不同时间尺度上提取更好的表示。总体而言,实证结果表明,我们提出的方法在多个检索基准上超越了 SOTA 方法,尤其是在长视频上,并在分类基准上表现极具竞争力。

关键词

引用

@article{arxiv.2403.14870,
  title  = {VidLA: Video-Language Alignment at Scale},
  author = {Mamshad Nayeem Rizve and Fan Fei and Jayakrishnan Unnikrishnan and Son Tran and Benjamin Z. Yao and Belinda Zeng and Mubarak Shah and Trishul Chilimbi},
  journal= {arXiv preprint arXiv:2403.14870},
  year   = {2024}
}

备注

Accepted to CVPR 2024