中文

QCaption:通过大型多模态模型融合实现视频字幕与问答

计算机视觉与模式识别 2026-01-13 v1 人工智能

摘要

本文介绍了 QCaption,一种新型视频字幕和问答管道,通过融合三个模型增强视频分析:关键帧提取、用于图像-文本分析的大型多模态模型(Large Multimodal Model, LMM)以及用于文本分析的大型语言模型(Large Language Model, LLM)。这种方法实现了对文本、图像和视频的集成分析,显著优于现有视频字幕和问答模型,同时保持完全自包含,适合本地部署。使用 QCaption 进行的实验结果显示,在视频字幕和问答任务中分别实现了最高 44.2% 和 48.9% 的性能提升。还进行了消融研究,以评估 LLM 在融合中的作用。此外,本文提出并评估了其他视频字幕方法,与 QCaption 及现有方法进行了基准测试。QCaption 证明了在推进视频分析方面采用模型融合方法的潜力。

关键词

引用

@article{arxiv.2601.06566,
  title  = {QCaption: Video Captioning and Q&A through Fusion of Large Multimodal Models},
  author = {Jiale Wang and Gee Wah Ng and Lee Onn Mak and Randall Cher and Ng Ding Hei Ryan and Davis Wang},
  journal= {arXiv preprint arXiv:2601.06566},
  year   = {2026}
}