中文

为视频事件关系预测中的结构化符号表示辩护

计算机视觉与模式识别 2023-04-13 v2

摘要

理解视频中的事件关系需要模型理解事件的底层结构(即事件类型、相关的论元角色及对应实体)以及用于推理的事实知识。基于结构化符号表示(SSR)的方法直接将事件类型和相关论元角色/实体作为输入来进行推理。然而,最先进的视频事件关系预测系统显示了使用来自输入视频的连续特征向量的必要性;仅基于SSR输入的现有方法完全失败,即使给定预言机事件类型和论元角色。在本文中,我们进行了广泛的实证分析以回答以下问题:1)基于SSR的方法为何失败;2)如何正确理解视频事件关系预测的评价设定;3)如何发掘基于SSR方法的潜力。我们首先确定次优的训练设定是导致先前基于SSR的视频事件预测模型失败的原因。然后通过定性和定量分析,我们展示了仅以视频作为输入的评估目前为何不可行,以及依赖预言机事件信息以获得准确评估的必要性。基于这些发现,我们提出将基于SSR的模型进一步上下文化为事件序列模型,并通过一种简单而有效的方式将外部视觉常识知识库重构为事件关系预测预训练数据集,从而为其配备更多事实知识。最终得到的新最先进模型实现了25%的宏准确率性能提升。

关键词

引用

@article{arxiv.2301.03410,
  title  = {In Defense of Structural Symbolic Representation for Video Event-Relation Prediction},
  author = {Andrew Lu and Xudong Lin and Yulei Niu and Shih-Fu Chang},
  journal= {arXiv preprint arXiv:2301.03410},
  year   = {2023}
}

备注

CVPRW 23, Learning with Limited Labelled Data