通过下一事件预测促进视频推理
计算机视觉与模式识别
2025-05-29 v1 人工智能
计算与语言
摘要
下一token预测是使LLM具备推理能力的基础学习任务。但当旨在赋予MLLM对视频输入的时间推理能力时,学习任务应该是什么?现有的任务如视频问答通常依赖人类或更强的MLLM的标注,而视频描述往往将时间推理与空间信息纠缠在一起。为了填补这一空白,我们提出下一事件预测(NEP),这是一种利用未来视频片段作为丰富的自监督信号来促进时间推理的学习任务。我们将每个视频分割为过去帧和未来帧:MLLM将过去帧作为输入,并预测从未来帧中衍生的事件摘要,从而鼓励模型进行时间推理以完成任务。为了支持这一任务,我们整理了V1-33K,一个包含33,000个自动提取的视频片段的数据集,涵盖多样化的真实世界场景。我们进一步探索了一系列视频指令微调策略,以研究它们对时间推理的影响。为了评估进展,我们引入了FutureBench来评估预测未见未来事件的一致性。实验验证了NEP为促进MLLM的时间推理提供了一种可扩展且有效的训练范式。
引用
@article{arxiv.2505.22457,
title = {Fostering Video Reasoning via Next-Event Prediction},
author = {Haonan Wang and Hongfu Liu and Xiangyan Liu and Chao Du and Kenji Kawaguchi and Ye Wang and Tianyu Pang},
journal= {arXiv preprint arXiv:2505.22457},
year = {2025}
}