面向直接场景图生成的结构化 Sparse R-CNN
计算机视觉与模式识别
2022-03-29 v2
摘要
场景图生成(SGG)旨在检测图像中具有关系的物体对。现有 SGG 方法常使用多阶段流水线将该任务分解为物体检测、关系图构建以及稠密或稠密到稀疏的关系预测。相反,从将 SGG 视为直接集合预测的角度,本文提出一个简单、稀疏且统一的框架,称为结构化 Sparse R-CNN。我们方法的关键是一组可学习的三元组查询以及一个结构化三元组检测器,其可在端到端方式中从训练集联合优化。具体而言,三元组查询编码物体对及其关系的通用先验,并为后续细化提供场景图的初始猜测。三元组检测器提出级联架构,以通过定制的动态头逐步细化检测到的场景图。此外,为缓解我们方法的训练难度,我们提出基于来自 Siamese Sparse R-CNN 的知识蒸馏的宽松且增强的训练策略。我们在多个数据集上实验:Visual Genome 与 Open Images V4/V6,结果表明我们的方法实现了最先进性能。此外,我们还进行了深入消融研究,以对三元组检测器设计与训练策略中的结构化建模提供见解。代码与模型见 https://github.com/MCG-NJU/Structured-Sparse-RCNN。
引用
@article{arxiv.2106.10815,
title = {Structured Sparse R-CNN for Direct Scene Graph Generation},
author = {Yao Teng and Limin Wang},
journal= {arXiv preprint arXiv:2106.10815},
year = {2022}
}
备注
Camera-ready version of CVPR 2022