中文

用于生成动态场景图的跨模态时变关系学习

计算机视觉与模式识别 2023-05-16 v1

摘要

从视频片段生成的动态场景图有助于增强在环境感知、自动驾驶车辆与移动机器人的自主导航和任务规划等广泛挑战性任务中的语义视觉理解。在动态场景图生成过程中的时空建模里,学习帧间动态场景图中的时变关系尤为困难。本文提出一种时变关系感知 Transformer(TR2^2),旨在对动态场景图中关系的时序变化进行建模。显式地,我们利用关于关系标签的提示句子的文本嵌入差异作为关系的监督信号。以此方式,实现了跨模态特征引导用于时变关系的学习。隐式地,我们设计了一个带 transformer 和描述相邻帧差异的额外消息令牌的关系特征融合模块。在 Action Genome 数据集上的大量实验证明,我们的 TR2^2 能有效建模时变关系。在两种不同设置下,TR2^2 分别以 2.1% 和 2.6% 显著优于先前的最先进方法。

关键词

引用

@article{arxiv.2305.08522,
  title  = {Cross-Modality Time-Variant Relation Learning for Generating Dynamic Scene Graphs},
  author = {Jingyi Wang and Jinfa Huang and Can Zhang and Zhidong Deng},
  journal= {arXiv preprint arXiv:2305.08522},
  year   = {2023}
}

备注

Preprint. Accepted by ICRA 2023