CaReBench:用于视频字幕与检索的细粒度基准
计算机视觉与模式识别
2025-03-19 v2 信息检索
机器学习
摘要
视频理解,包括视频字幕和检索,是视频语言模型(VLM)仍面临的重大挑战。现有的视频检索和字幕基准仅包含简短描述,限制了其进行细粒度视频理解评估的能力。为此,我们提出了 CaReBench,一个用于细粒度视频字幕与检索的测试基准,包含 1000 对高质量的视频与人工标注的详细字幕。独特之处在于,为每个视频手动分离的空间标注和时间标注。基于此设计,我们引入两个评估指标,分别为视频检索和视频字幕任务量身定制:ReBias 和 CapST。这些指标使我们能够全面探讨VLM 中内在的空间与时间偏差。此外,为在统一框架下处理视频检索和视频字幕两个任务,我们开发了一个基于多模态语言模型(MLLM)的简单基线。通过实施两阶段监督微调(SFT),我们充分发掘了 MLLM 的潜力,使其不仅能生成详细的视频描述,还能提取视频特征。意外的是,实验结果表明,与专为检索设计的 CLIP 模型以及擅长视频字幕的流行 MLLM 相比,我们的基线在细粒度视频检索和视频详细字幕方面表现出竞争力。
引用
@article{arxiv.2501.00513,
title = {CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval},
author = {Yifan Xu and Xinhao Li and Yichun Yang and Desen Meng and Rui Huang and Limin Wang},
journal= {arXiv preprint arXiv:2501.00513},
year = {2025}
}