视频思考:从感知到认知的逐步视频推理
人工智能
2025-01-08 v1 计算机视觉与模式识别
摘要
现有的视频理解研究在复杂视频中实现深层理解与推理仍面临挑战,主要源于两个关键瓶颈的充分挖掘不足:细粒度时空感知理解和认知层次的视频场景理解。本文通过提出一种新方案来弥合这一差距。我们首先引入一种新型视频多模态大语言模型(MLLM),名为 MotionEpic,通过集成视频时空场景图(STSG)表示,实现像素级时空视频 grounding。基于 MotionEpic,我们随后开发了视频思考(Video-of-Thought,VoT)推理框架。VoT 继承了链式思考(Chain-of-Thought,CoT)的核心思想,将复杂任务分解为更简单可管理的子问题,按顺序从低层像素感知到高层认知解释进行解决。广泛的实验表明,我们的整体框架显著提升了现有的 SOTA 水平。据我们所知,这是首次成功地将 CoT 技术应用于实现类人视频推理,展现了将其扩展到更广泛视频理解场景的巨大潜力。项目已开源于 https://haofei.vip/VoT。
引用
@article{arxiv.2501.03230,
title = {Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition},
author = {Hao Fei and Shengqiong Wu and Wei Ji and Hanwang Zhang and Meishan Zhang and Mong-Li Lee and Wynne Hsu},
journal= {arXiv preprint arXiv:2501.03230},
year = {2025}
}
备注
Accepted by ICML 2024