中文

Video-CoE:通过事件链强化视频事件预测

计算机视觉与模式识别 2026-03-17 v1

摘要

尽管 MLLMs 在 various video 任务中取得了进展,但视频事件预测(VEP)仍相对未被充分探索。VEP 需要模型对视频进行细粒度的时间建模,并建立视频与未来事件之间的逻辑关系,而当前的 MLLMs 仍难以实现。本文首先对当前领先的 MLLMs 在 VEP 任务上的表现进行全面评估,揭示其预测不准确的原因,包括缺乏对未来事件预测的逻辑推理能力以及对视觉信息的利用不足。为此,我们提出“事件链”(CoE)范式,通过构建事件链来隐式强化 MLLM 关注视频内容与未来事件之间的逻辑连接,激励模型具备推理能力,并通过多种训练协议进行优化。实验结果表明,我们的方法在公开基准数据集上超越了领先的开源和商业 MLLMs,在 VEP 任务上取得了新的状态突破。代码和模型将很快公开。

关键词

引用

@article{arxiv.2603.14935,
  title  = {Video-CoE: Reinforcing Video Event Prediction via Chain of Events},
  author = {Qile Su and Jing Tang and Rui Chen and Lei Sun and Xiangxiang Chu},
  journal= {arXiv preprint arXiv:2603.14935},
  year   = {2026}
}

备注

21 pages, 18 figures, 6 tables