中文

VideoCon:基于对比字幕的鲁棒视频-语言对齐

计算机视觉与模式识别 2023-11-20 v1 人工智能 计算与语言 机器学习

摘要

尽管最先进的视频-语言对齐模型在海量数据上进行了(预)训练,它们对视频字幕中语义合理对比变化的鲁棒性仍然不足。我们的工作通过识别广泛的对比失配对(如替换实体、动作以及翻转事件顺序)来解决此问题,对齐模型应对这些变化具有鲁棒性。为此,我们引入了 VideoCon,一个由大语言模型构建的视频-语言对齐数据集,该模型生成合理的对比视频字幕以及原始与对比视频字幕之间差异的解释。随后,一个生成式视频-语言模型使用 VideoCon 进行微调,以评估视频-语言蕴含关系并生成解释。我们基于 VideoCon 的对齐模型显著优于当前模型。在人类生成的对比字幕的视频-语言对齐任务中,其 AUC 提升了 12 个百分点。最后,我们的模型在时间扩展的视频-语言任务(如文本到视频检索(SSv2-Temporal)和视频问答(ATP-Hard))中确立了新的 SOTA 零样本性能。此外,我们的模型在全新视频以及人工撰写的字幕和解释上展现出优越性能。我们的代码和数据可在 https://github.com/Hritikbansal/videocon 获取。

关键词

引用

@article{arxiv.2311.10111,
  title  = {VideoCon: Robust Video-Language Alignment via Contrast Captions},
  author = {Hritik Bansal and Yonatan Bitton and Idan Szpektor and Kai-Wei Chang and Aditya Grover},
  journal= {arXiv preprint arXiv:2311.10111},
  year   = {2023}
}

备注

22 pages, 19 Figures, 7 Tables