中文

CFVBench:细粒度多模态检索增强生成的综合视频基准

计算与语言 2025-10-13 v1

摘要

多模态检索增强生成(MRAG)使多模态大语言模型(MLLM)能够借助外部多模态证据生成响应,已有多种基于视频的MRAG基准被提出用于评估模型在检索和生成阶段的能力。然而,现有基准在模态覆盖和格式多样性方面仍然有限,通常聚焦于单模态或有限模态任务,或粗粒度场景理解。为解决这些不足,我们引入了CFVBench,一个大规模、人工验证的基准,由599个公开视频构建而成,产生5,360个开放式问答对。CFVBench涵盖高密度格式和领域,如图表密集的报告、新闻广播和软件教程,要求模型在保持细粒度多模态信息的同时检索和推理长时序视频片段。利用CFVBench,我们系统评估了7种检索方法和14种广泛使用的MLLM,揭示了一个关键瓶颈:当前模型(即使是GPT-5或Gemini)也难以捕捉短暂但关键的细粒度多模态细节。为缓解这一问题,我们提出了自适应视觉细化(AVR),一个简单而有效的框架,可根据需要自适应地增加帧采样密度并选择性调用外部工具。实验表明,AVR始终增强细粒度多模态理解,并在所有评估的MLLM上提升了性能。

关键词

引用

@article{arxiv.2510.09266,
  title  = {CFVBench: A Comprehensive Video Benchmark for Fine-grained Multimodal Retrieval-Augmented Generation},
  author = {Kaiwen Wei and Xiao Liu and Jie Zhang and Zijian Wang and Ruida Liu and Yuming Yang and Xin Xiao and Xiao Sun and Haoyang Zeng and Changzai Pan and Yidan Zhang and Jiang Zhong and Peijin Wang and Yingchao Feng},
  journal= {arXiv preprint arXiv:2510.09266},
  year   = {2025}
}