中文

OED:面向动态场景图生成的单阶段端到端框架

计算机视觉与模式识别 2024-05-28 v1

摘要

动态场景图生成 (DSGG) 旨在识别视频中时空领域内的视觉关系。传统方法通常采用多阶段管道,包括目标检测、时序关联和多关系分类。然而,这些方法由于多个阶段的分离,存在固有的局限性,独立优化这些子问题可能导致次优解。为缓解这些局限性,我们提出一种单阶段端到端框架,称为 OED,将 DSGG 管道简化为一阶段。该框架将任务重新表述为集合预测问题,并利用成对特征表示场景图中每个主体-客体对。另一方面,DSGG 的另一个挑战是捕获时序依赖性,我们引入渐进式细化模块 (PRM),无需额外跟踪器或手工轨迹,即可聚合时序上下文,实现网络的端到端优化。在 Action Genome 数据集上的大量实验表明,我们设计的有效性。代码和模型可在 \url{https://github.com/guanw-pku/OED} 获取。

关键词

引用

@article{arxiv.2405.16925,
  title  = {OED: Towards One-stage End-to-End Dynamic Scene Graph Generation},
  author = {Guan Wang and Zhimin Li and Qingchao Chen and Yang Liu},
  journal= {arXiv preprint arXiv:2405.16925},
  year   = {2024}
}

备注

Accepted by CVPR'24