中文

通过追踪论元的视觉状态实现视频事件抽取

计算机视觉与模式识别 2022-11-08 v2 计算与语言

摘要

视频事件抽取旨在从视频中检测显著事件,并识别每个事件的论元及其语义角色。现有方法侧重于捕捉每帧的整体视觉场景,忽略了细粒度的论元级信息。受事件定义为状态变化这一观念的启发,我们提出一种新颖框架,通过追踪所有相关论元的视觉状态变化来检测视频事件,这些变化有望为视频事件抽取提供最具信息量的证据。为捕捉论元的视觉状态变化,我们将其分解为物体内部像素的变化、物体的位移以及多个论元之间的交互。我们进一步提出对象状态嵌入、对象运动感知嵌入和论元交互嵌入,分别对这些变化进行编码与追踪。在多种视频事件抽取任务上的实验表明,相较于最先进的模型取得了显著改进。特别是在动词分类上,我们在 Video Situation Recognition 的 F1@5 上取得了 3.49% 的绝对提升(19.53% 的相对提升)。

关键词

引用

@article{arxiv.2211.01781,
  title  = {Video Event Extraction via Tracking Visual States of Arguments},
  author = {Guang Yang and Manling Li and Jiajie Zhang and Xudong Lin and Shih-Fu Chang and Heng Ji},
  journal= {arXiv preprint arXiv:2211.01781},
  year   = {2022}
}