VideoComp:提升视频-文本模型中的细粒度组成性和时序对齐
计算机视觉与模式识别
2025-04-11 v2 人工智能
计算与语言
信息检索
摘要
我们提出了 VideoComp,一个旨在提升视觉语言模型(VLM)在细粒度时序对齐方面能力的基准和学习框架,旨在增进视频-文本组成性理解。与现有聚焦静态图像-文本组成性或孤立单事件视频的基准不同,我们的基准针对的是连续多事件视频中的对齐问题。利用具有时序局部化事件标题的数据集(如 ActivityNet-Captions、YouCook2),我们构建了两个组成基准,ActivityNet-Comp 和 YouCook2-Comp。我们创建了具有细微时序扰乱的挑战性负样本,包括重新排序、动作词替换、部分标题化以及组合扰乱。这些基准全面测试模型在扩展且连贯的视频-文本序列中的组成敏感性。为提升模型性能,我们提出了层次化成对偏好损失,以强化与时序准确配对的对齐,并逐渐惩罚越来越受扰乱的配对,鼓励细粒度组成学习。为缓解稀疏标注视频数据有限的问题,我们引入了一种预训练策略,将短视频-标题配对拼接以模拟多事件序列。我们对视频-文本基础模型和大型多模态模型(LMM)进行了基准测试,确定了这些模型在组成性方面的优势和改进空间。总体而言,我们的工作提供了一个全面的框架,用于评估和提升模型在实现细粒度、时序连贯视频-文本对齐方面的能力。
引用
@article{arxiv.2504.03970,
title = {VideoComp: Advancing Fine-Grained Compositional and Temporal Alignment in Video-Text Models},
author = {Dahun Kim and AJ Piergiovanni and Ganesh Mallya and Anelia Angelova},
journal= {arXiv preprint arXiv:2504.03970},
year = {2025}
}
备注
CVPR 2025, project page at https://github.com/google-deepmind/video_comp