中文

EventFormer:面向事件导向的视频事件预测节点图层次注意力 Transformer

计算机视觉与模式识别 2025-10-28 v1 人工智能 多媒体

摘要

脚本事件诱导旨在基于上下文预测下一个事件,是NLP中的一个具有实际应用价值的挑战任务。然而,人类事件大多以视频形式记录和呈现,而在视觉领域缺乏相关研究。为此,我们引入AVEP (Action-centric Video Event Prediction),一种区别于现有视频预测任务的任务,其融合了更复杂的逻辑和更丰富的语义信息。我们构建了一个大型结构化数据集,包含约35K个标注视频和超过178K个视频片段事件,基于现有视频事件数据集构建。数据集提供更细粒度的标注,原子单位表示为多模态事件论点节点,为视频事件提供更结构化的表示。由于事件结构的复杂性,传统的以patch或帧为输入的视觉模型并不适用于AVEP。我们提出EventFormer,一种基于节点图层次注意力的视频事件预测模型,能够捕捉事件及其论点的关系,以及论点的指代关系。我们使用多个SOTA视频预测模型以及大语言模型 (LVLMs) 在AVEP上进行实验,展示了该任务的复杂性和数据集的价值。我们的做法超越了所有这些视频预测模型。我们将发布数据集和代码,以便复制实验和注释。

关键词

引用

@article{arxiv.2510.21786,
  title  = {EventFormer: A Node-graph Hierarchical Attention Transformer for Action-centric Video Event Prediction},
  author = {Qile Su and Shoutai Zhu and Shuai Zhang and Baoyu Liang and Chao Tong},
  journal= {arXiv preprint arXiv:2510.21786},
  year   = {2025}
}

备注

15 pages, 7 figures, 6 tables