QCaption:通过大型多模态模型融合实现视频字幕与问答
计算机视觉与模式识别
2026-01-13 v1 人工智能
摘要
本文介绍了 QCaption,一种新型视频字幕和问答管道,通过融合三个模型增强视频分析:关键帧提取、用于图像-文本分析的大型多模态模型(Large Multimodal Model, LMM)以及用于文本分析的大型语言模型(Large Language Model, LLM)。这种方法实现了对文本、图像和视频的集成分析,显著优于现有视频字幕和问答模型,同时保持完全自包含,适合本地部署。使用 QCaption 进行的实验结果显示,在视频字幕和问答任务中分别实现了最高 44.2% 和 48.9% 的性能提升。还进行了消融研究,以评估 LLM 在融合中的作用。此外,本文提出并评估了其他视频字幕方法,与 QCaption 及现有方法进行了基准测试。QCaption 证明了在推进视频分析方面采用模型融合方法的潜力。
引用
@article{arxiv.2601.06566,
title = {QCaption: Video Captioning and Q&A through Fusion of Large Multimodal Models},
author = {Jiale Wang and Gee Wah Ng and Lee Onn Mak and Randall Cher and Ng Ding Hei Ryan and Davis Wang},
journal= {arXiv preprint arXiv:2601.06566},
year = {2026}
}