融合大语言模型世界知识与视觉基础模型的视频事件推理与预测
计算机视觉与模式识别
2025-12-30 v3
摘要
当前的视频理解模型擅长识别“正在发生什么”,但在因果推理和未来预测等高级认知任务上表现不佳,这一局限源于它们缺乏常识性世界知识。为弥合这一认知差距,我们提出了一种新颖框架,该框架协同融合了用于深度视觉感知的强大视觉基础模型(VFM)和作为知识驱动推理核心的大语言模型(LLM)。我们的关键技术创新是一个受Q-Former架构启发的复杂融合模块,它将复杂的时空和以对象为中心的视觉特征提炼为简洁的、与语言对齐的表示。这使得LLM能够将其推理过程有效地基于直接的视觉证据。该模型通过两阶段策略进行训练,首先在视频-文本数据上进行大规模对齐预训练,然后在精心策划的数据集上进行有针对性的指令微调,以激发高级推理和预测技能。大量实验表明,我们的模型在多个具有挑战性的基准测试中达到了最先进的性能。值得注意的是,它展现了对未见推理任务的卓越零样本泛化能力,我们深入的消融研究验证了每个架构组件的关键贡献。这项工作将机器感知的边界从简单识别推向真正的认知理解,为机器人、人机交互等领域中更智能、更有能力的AI系统铺平了道路。
引用
@article{arxiv.2507.05822,
title = {Video Event Reasoning and Prediction by Fusing World Knowledge from LLMs with Vision Foundation Models},
author = {L'ea Dubois and Klaus Schmidt and Chengyu Wang and Ji-Hoon Park and Lin Wang and Santiago Munoz},
journal= {arXiv preprint arXiv:2507.05822},
year = {2025}
}
备注
22 pages, 4 figures