使用条件查询的单阶段视觉关系学习
计算机视觉与模式识别
2023-06-12 v1
摘要
场景图生成(SGG)的研究通常考虑两阶段模型,即先检测一组实体,再将其组合并标注所有可能关系。尽管结果可观,该流水线结构带来巨大参数与计算开销,且通常阻碍端到端优化。为此,近期研究尝试训练计算高效的单阶段模型。随着基于集合的检测模型DETR的出现,单阶段模型试图一次性直接预测一组主-谓-宾三元组。然而,SGG本质上是一个多任务学习问题,需同时建模实体与谓词分布。本文中,我们提出带条件查询的Transformer用于SGG,即TraCQ,其采用一种新的SGG表述,避免了多任务学习问题与组合式实体对分布。我们采用基于DETR的编码器-解码器设计,并利用条件查询显著缩减实体标签空间,从而相较最先进单阶段模型减少20%参数。实验结果表明,TraCQ不仅优于现有单阶段场景图生成方法,在Visual Genome数据集上也击败许多最先进两阶段方法,且能够进行端到端训练与更快推理。
引用
@article{arxiv.2306.05689,
title = {Single-Stage Visual Relationship Learning using Conditional Queries},
author = {Alakh Desai and Tz-Ying Wu and Subarna Tripathi and Nuno Vasconcelos},
journal= {arXiv preprint arXiv:2306.05689},
year = {2023}
}
备注
Accepted to NeurIPS 2022