中文

面向动态场景图生成的显著时序编码

计算机视觉与模式识别 2025-03-20 v1 机器学习

摘要

使用结构化时空场景图表示动态场景是一种新颖且尤其具有挑战性的任务。为解决此任务,关键在于学习场景中物体之间的时序相互作用,而不仅仅是其空间关系。由于当前基准数据集缺乏显式标注的时序关系,大多数现有的时空场景图生成方法会在所有物体跨帧之间构建稠密且抽象的时序连接。然而,并非所有时序连接都编码有意义的时序动态。我们提出一种新颖的时空场景图生成方法,仅在时序相关物体对之间选择构建时序连接,并将时序关系表示为场景图中的显式边。 resulting 的稀疏且显式的时序表示允许我们在场景图检测中对强大的场景图生成基线提升最高可达 4.4%4.4\%。此外,我们展示了该方法可用于改进下游视觉任务。特别地,将该方法应用于动作识别,显示在场景图检测 mAP 上较当前沙方法提升 0.6%。

关键词

引用

@article{arxiv.2503.14524,
  title  = {Salient Temporal Encoding for Dynamic Scene Graph Generation},
  author = {Zhihao Zhu},
  journal= {arXiv preprint arXiv:2503.14524},
  year   = {2025}
}