中文

HIG:视频理解中场景图生成的分层交织图方法

计算机视觉与模式识别 2024-03-18 v3

摘要

视觉场景中的视觉交互理解是计算机视觉中的一个重大挑战。现有方法侧重于复杂的交互,同时利用简单的关系模型。然而,这些方法难以应对视频中外观、情境、位置、交互和关系的多样性。这一局限性阻碍了完全理解主体复杂视觉动态中相互作用的能力。在本文中,我们通过从人与物体之间的密集交互中推导出场景图表示,深入研究了视觉内容中的交互理解。为了实现这一目标,我们首先提出了一个包含外观-情境-位置-交互-关系谓词的新数据集,名为ASPIRe,它提供了大量以广泛交互为特征的视频集合。然后,我们提出了一种名为分层交织图(Hierarchical Interlacement Graph, HIG)的新方法,该方法利用分层结构中的统一层和图,为跨五个不同任务的场景变化提供深刻见解。通过在多种场景下进行的大量实验,我们的方法展示了优于其他方法的性能。

关键词

引用

@article{arxiv.2312.03050,
  title  = {HIG: Hierarchical Interlacement Graph Approach to Scene Graph Generation in Video Understanding},
  author = {Trong-Thuan Nguyen and Pha Nguyen and Khoa Luu},
  journal= {arXiv preprint arXiv:2312.03050},
  year   = {2024}
}

备注

Accepted to CVPR 2024