单人小队:模型协同破解复杂视频问答
计算机视觉与模式识别
2025-07-21 v1 人工智能
摘要
我们提出了一个用于开放式视频问答的新框架,通过协调多个异构视频语言模型(VLMs)通过结构化思考链条来增强推理深度和鲁棒性,评估基准为 CVRR-ES 数据集。现有的视频大型多模态模型(Video-LMMs)常表现出有限的上下文理解、弱的时间建模以及对模糊或组合查询的poor泛化。在面对这些挑战方面,我们引入一种提示-响应集成机制,通过结构化思考链路协调多个异构VLMs,每一种都针对不同的推理路径进行优化。外部大型语言模型(LLM)作为评估者和集成器,选择并融合最可靠的响应。大量实验表明,我们的方法在所有评估指标上均显著优于现有基线,展现出卓越的泛化和鲁棒性。我们的做法提供了一种轻量、可扩展的策略,推动多模态推理发展,无需模型重新训练,为未来的Video-LMM开发奠定了坚实的基础。
引用
@article{arxiv.2507.13820,
title = {Team of One: Cracking Complex Video QA with Model Synergy},
author = {Jun Xie and Zhaoran Zhao and Xiongjun Guan and Yingjian Zhu and Hongzhu Yi and Xinming Wang and Feng Chen and Zhepeng Wang},
journal= {arXiv preprint arXiv:2507.13820},
year = {2025}
}