中文

VideoCLIP-XL:提升视频 CLIP 模型的长描述理解能力

计算与语言 2024-10-07 v2 计算机视觉与模式识别 多媒体

摘要

对比语言-图像预训练(CLIP)已被广泛研究和应用于诸多场景。然而,预训练时对简短摘要文本的强调,阻碍了 CLIP 理解长描述的能力。这一问题在视频领域尤为突出,因为视频常包含丰富的详细内容。本文提出了 VideoCLIP-XL(eXtra Length)模型,旨在发掘视频 CLIP 模型的长描述理解能力。首先,我们建立了一个自动数据收集系统,收集了大规模的 VILD 预训练数据集,其中包含视频与长描述的配对。随后,我们提出了基于文本相似性的主要组件匹配(Text-similarity-guided Primary Component Matching, TPCM),以更好地学习特征空间的分布,同时扩充长描述的能力。我们还引入两种新任务,即细节感知描述排序(Detail-aware Description Ranking, DDR)和幻觉感知描述排序(Hallucination-aware Description Ranking, HDR),以进一步提升理解能力。最后,我们构建了一个长视频描述排序(Long Video Description Ranking, LVDR)基准,更全面地评估长描述能力。在广泛使用的文本-视频检索基准上进行的大量实验结果,以及我们的 LVDR 基准,充分展示了我们方法的有效性。

关键词

引用

@article{arxiv.2410.00741,
  title  = {VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models},
  author = {Jiapeng Wang and Chengyu Wang and Kunzhe Huang and Jun Huang and Lianwen Jin},
  journal= {arXiv preprint arXiv:2410.00741},
  year   = {2024}
}

备注

EMNLP 2024 Main conference