中文

VERIFIED:面向细粒度视频理解的视频语料库时序检索基准

计算机视觉与模式识别 2024-10-14 v1 人工智能

摘要

现有的视频语料库时序检索(VCMR)受限于粗粒度理解,导致在给定细粒度查询时无法实现精确的视频时段定位。本文提出更具挑战性的细粒度VCMR基准,要求方法从语料库中定位与查询最匹配的时段,同时考虑其他部分匹配的候选选项。为提高数据构建效率并保证高质量标注,我们提出了VERIFIED框架,即自动化视频-文本标注管道,生成具有可靠细粒度静态与动态内容的描述。具体而言,我们采用大语言模型(LLM)和大多模态模型(LMM),结合我们提出的静态与动态增强描述模块,为每个视频生成多样化的细粒度描述。为过滤由LLM幻觉引起的错误标注,我们提出了细粒度感知噪声评估器,通过微调视频基础模型,引入扰动硬负例增强的对比和匹配损失。基于VERIFIED,我们构建了一个更具挑战性的细粒度VCMR基准,包含Charades-FIG、DiDeMo-FIG和ActivityNet-FIG,显示出高水平的标注质量。我们在所提数据集上评估了多个最新VCMR模型,结果表明在VCMR中仍有显著的细粒度视频理解空间。代码与数据集已公开。

关键词

引用

@article{arxiv.2410.08593,
  title  = {VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding},
  author = {Houlun Chen and Xin Wang and Hong Chen and Zeyang Zhang and Wei Feng and Bin Huang and Jia Jia and Wenwu Zhu},
  journal= {arXiv preprint arXiv:2410.08593},
  year   = {2024}
}

备注

Accepted by 38th NeurIPS Datasets & Benchmarks Track (NeurIPS 2024)