中文

文本到视频生成能否帮助视频语言对齐?

计算机视觉与模式识别 2025-03-25 v1

摘要

最近的视频语言对齐模型是在每个视频上配associated positive caption和由大语言模型生成的negative caption的集合上训练的。这一做法的一个问题是,negative caption可能引入语言偏置,即概念仅被看到为negative,却从未与视频关联。虽然收集negative caption对应的视频是解决方案,但现有数据库缺乏覆盖所有可能的negative所需的细粒度变化。在本工作中,我们研究是否存在合成视频可以克服这一问题。我们的初步分析显示,尽管在某些任务上表现有前景,但合成视频在其他任务上会损害模型性能。我们假设这一问题与生成视频中的噪声(语义和视觉)有关,并提出了一种方法SynViTA,以此为基础。SynViTA根据每个合成视频其目标caption与真实caption的相似度,动态调整其贡献的权重。此外,语义一致性损失使模型专注于caption之间细粒度差异,而非视频外观差异。实验表明,在VideoCon测试集以及SSv2-Temporal、SSv2-Events和ATP-Hard基准上,SynViTA平均优于现有方法,为在学习视频语言模型时使用合成视频提供了第一个有前景的步骤。

关键词

引用

@article{arxiv.2503.18507,
  title  = {Can Text-to-Video Generation help Video-Language Alignment?},
  author = {Luca Zanella and Massimiliano Mancini and Willi Menapace and Sergey Tulyakov and Yiming Wang and Elisa Ricci},
  journal= {arXiv preprint arXiv:2503.18507},
  year   = {2025}
}

备注

CVPR 2025. Project website at https://lucazanella.github.io/synvita/