中文

构建用于视频语义角色标注的整体时空场景图

计算机视觉与模式识别 2023-08-15 v2 计算与语言

摘要

视频语义角色标注(VidSRL)旨在从给定视频中检测显著事件,通过识别谓词-论元事件结构以及事件间的相互关系。尽管近期工作提出了一些 VidSRL 方法,它们大多存在两个关键缺陷,包括缺乏细粒度空间场景感知以及对视频时间性建模不足。为此,本文基于现有动态场景图结构探索了一种新颖的整体时空场景图(称为 HostSG)表示,其很好地建模了视频的细粒度空间语义与时间动态以用于 VidSRL。基于 HostSG,我们提出了一个针对性 VidSRL 框架。首先设计场景-事件映射机制以弥合底层场景结构与高层事件语义结构之间的鸿沟,形成整体的分层场景-事件(称为 ICE)图结构。我们进一步执行迭代结构精炼以优化 ICE 图,使得整体结构表示能最佳契合末端任务需求。最后,VidSRL 的三个子任务预测被联合解码,其中端到端范式有效避免了错误传播。在基准数据集上,我们的框架相较当前最佳模型取得显著提升。进一步的分析展示了对我们方法先进性的更好理解。

关键词

引用

@article{arxiv.2308.05081,
  title  = {Constructing Holistic Spatio-Temporal Scene Graph for Video Semantic Role Labeling},
  author = {Yu Zhao and Hao Fei and Yixin Cao and Bobo Li and Meishan Zhang and Jianguo Wei and Min Zhang and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2308.05081},
  year   = {2023}
}

备注

Accepted by ACM MM 2023