中文

Chain-of-Frames:通过帧感知推理推进多模态 LLM 中的视频理解

计算机视觉与模式识别 2026-04-07 v2

摘要

最近的工作表明,引导大型语言模型 (LLM) 在回答用户请求之前用自然语言生成推理轨迹,可以显著提高它们在各种任务中的表现。这种方法已被扩展到多模态 LLM,其中模型可以针对输入图像和视频的内容生成思维链。对于视频输入,先前的工作使用复杂的多步流水线从视频中提取相关帧并将其包含在思维链中,或者以较差的时间定位为代价产生更简单的单阶段推理轨迹。在这里,我们提出了首个具有单阶段推理的视频 LLM,其中包含对相关帧的显式引用,从而减少了推理过程中的时间不一致性。我们的方法简单、统一且自包含,采用单阶段推理来处理复杂的视频理解任务,而无需依赖辅助模块进行帧选择或字幕生成。为此,我们首先创建了 COF-DATA,这是一个大型数据集,包含来自自然和合成视频的各种问题、答案以及相应的帧定位推理轨迹,涵盖各种主题和任务。我们的模型通过在此帧链 数据上微调视频 LLM 获得,能够生成准确识别关键帧以回答给定问题的推理轨迹。反过来,这在多个视频理解基准上持续提升了性能。令人惊讶的是,我们发现仅合成数据尽管相对于这些真实世界基准是分布外的,却显著提升了模型准确率。代码可在 https://github.com/SaraGhazanfari/CoF 获取。

关键词

引用

@article{arxiv.2506.00318,
  title  = {Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning},
  author = {Sara Ghazanfari and Francesco Croce and Nicolas Flammarion and Prashanth Krishnamurthy and Farshad Khorrami and Siddharth Garg},
  journal= {arXiv preprint arXiv:2506.00318},
  year   = {2026}
}

备注

Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026