EGTR:从 Transformer 中提取图用于场景图生成
计算机视觉与模式识别
2024-06-25 v5 机器学习
摘要
场景图生成 (SGG) 是一项具有挑战性的任务,需要检测物体并预测物体之间的关系。自 DETR 提出以来,基于单阶段目标检测器的单阶段 SGG 模型得到了积极研究。然而,现有方法使用复杂的建模来预测物体之间的关系,却忽略了目标检测器的多头自注意力中学习到的目标查询之间的内在关系。我们提出了一种轻量级的单阶段 SGG 模型,该模型从 DETR 解码器的多头自注意力层学习到的各种关系中提取关系图。通过充分利用自注意力的副产品,可以通过浅层关系提取头有效地提取关系图。考虑到关系提取任务对目标检测任务的依赖性,我们提出了一种新颖的关系平滑技术,该技术根据检测到的物体的质量自适应地调整关系标签。通过关系平滑,模型按照连续的课程进行训练,在训练初期专注于目标检测任务,并随着目标检测性能的逐步提升执行多任务学习。此外,我们提出了一项连接性预测任务,作为关系提取的辅助任务,用于预测物体对之间是否存在关系。我们在 Visual Genome 和 Open Image V6 数据集上展示了我们方法的有效性和效率。我们的代码已在 https://github.com/naver-ai/egtr 公开发布。
引用
@article{arxiv.2404.02072,
title = {EGTR: Extracting Graph from Transformer for Scene Graph Generation},
author = {Jinbae Im and JeongYeon Nam and Nokyung Park and Hyungmin Lee and Seunghyun Park},
journal= {arXiv preprint arXiv:2404.02072},
year = {2024}
}
备注
CVPR 2024 (Best paper award candidate)