OED:面向动态场景图生成的单阶段端到端框架
计算机视觉与模式识别
2024-05-28 v1
摘要
动态场景图生成 (DSGG) 旨在识别视频中时空领域内的视觉关系。传统方法通常采用多阶段管道,包括目标检测、时序关联和多关系分类。然而,这些方法由于多个阶段的分离,存在固有的局限性,独立优化这些子问题可能导致次优解。为缓解这些局限性,我们提出一种单阶段端到端框架,称为 OED,将 DSGG 管道简化为一阶段。该框架将任务重新表述为集合预测问题,并利用成对特征表示场景图中每个主体-客体对。另一方面,DSGG 的另一个挑战是捕获时序依赖性,我们引入渐进式细化模块 (PRM),无需额外跟踪器或手工轨迹,即可聚合时序上下文,实现网络的端到端优化。在 Action Genome 数据集上的大量实验表明,我们设计的有效性。代码和模型可在 \url{https://github.com/guanw-pku/OED} 获取。
引用
@article{arxiv.2405.16925,
title = {OED: Towards One-stage End-to-End Dynamic Scene Graph Generation},
author = {Guan Wang and Zhimin Li and Qingchao Chen and Yang Liu},
journal= {arXiv preprint arXiv:2405.16925},
year = {2024}
}
备注
Accepted by CVPR'24