中文

基于视频片段中物体行为推理的副词类型识别

计算机视觉与模式识别 2024-03-29 v3 人工智能 符号计算

摘要

在这项工作中,基于描述场景序列的副词最好通过对物体行为的高层概念进行推理来识别这一直觉,我们提出了一种新框架的设计,该框架对从原始视频片段中提取的物体行为进行推理,以识别片段对应的副词类型。重要的是,先前用于通用场景副词识别的工作都假设已知片段底层的动作类型,而我们的方法可直接应用于更通用的问题设定,即视频片段的动作类型未知。具体而言,我们提出了一种新颖的流程,从原始视频片段中提取人类可解释的物体行为事实,并提出了基于符号和 transformer 的推理新方法,这些方法对这些提取的事实进行运算以识别副词类型。实验结果表明,我们提出的方法优于先前的最先进方法。此外,为支持符号视频处理方面的研究,我们发布了两个从原始视频片段提取的物体行为事实新数据集——MSR-VTT-ASP 和 ActivityNet-ASP 数据集。

关键词

引用

@article{arxiv.2307.04132,
  title  = {Reasoning over the Behaviour of Objects in Video-Clips for Adverb-Type Recognition},
  author = {Amrit Diggavi Seshadri and Alessandra Russo},
  journal= {arXiv preprint arXiv:2307.04132},
  year   = {2024}
}