中文

用于快速视频理解的 VideoAds

计算机视觉与模式识别 2025-10-14 v2

摘要

广告视频是丰富且宝贵的目的导向信息来源,包含高质量的视觉、文本和上下文线索,用于吸引观众者。它们通常比类似时长的常规视频更复杂,due to其结构化叙事和快速场景转换,给多模态大语言模型(MLLM)带来显著挑战。本工作介绍VideoAds,首个针对评估MLLM在广告视频性能基准的数据集。VideoAds包含精心策划的广告视频,拥有复杂的时间结构, accompanied by手动标注的多样化问题,覆盖三个核心任务:视觉查找、视频摘要和视觉推理。我们提出一种量化措施,用于将VideoAds与现有基准进行视频复杂度比较。通过大量实验,我们发现Qwen2.5-VL-72B,这一开源MLLM,在VideoAds上实现了73.35%的准确率,超越GPT-4o(66.82%)和Gemini-1.5 Pro(69.66%);两种专有模型在视频摘要和推理方面特别落后于开源模型,但在视觉查找方面表现最佳。值得注意的是,人类专家轻松实现了惊人的94.27%准确率。这项结果凸显了需要发展MLLM的时序建模能力的必要性,并将VideoAds置于未来研究理解需要高帧率抽样的视频的关键基准。该数据集和评估代码将在 https://videoadsbenchmark.netlify.app 上公开。

关键词

引用

@article{arxiv.2504.09282,
  title  = {VideoAds for Fast-Paced Video Understanding},
  author = {Zheyuan Zhang and Monica Dou and Linkai Peng and Hongyi Pan and Ulas Bagci and Boqing Gong},
  journal= {arXiv preprint arXiv:2504.09282},
  year   = {2025}
}

备注

ICCV2025