基于Transformer的视觉关系检测的分组查询专业化与质量感知多分配
计算机视觉与模式识别
2024-03-27 v1
摘要
视觉关系检测(VRD)近年来随着基于Transformer的架构取得了显著进展。然而,我们发现了在训练基于Transformer的VRD模型时,传统标签分配(即将真实值(GT)映射到预测的过程)中的两个关键局限性。在传统分配下,由于一个查询被期望检测每一种关系,因此会训练出一个非专业化的查询,这使得查询难以专门处理特定关系。此外,由于一个GT仅分配给单个预测,因此查询的训练也不充分,因为接近正确甚至正确的预测会因未被分配任何关系作为GT而被抑制。为了解决这些问题,我们提出了分组查询专业化与质量感知多分配(SpeaQ)。分组查询专业化通过将查询和关系划分为不相交的组,并引导特定查询组中的查询仅针对相应关系组中的关系,从而训练专业化的查询。质量感知多分配通过将GT分配给在主体、客体以及它们之间的关系方面与GT非常接近的多个预测,进一步促进了训练。实验结果和分析表明,SpeaQ有效地训练了专业化查询,更好地利用了模型的容量,从而在多个VRD模型和基准测试中,以零额外推理成本实现了持续的性能提升。代码可在https://github.com/mlvlab/SpeaQ获取。
引用
@article{arxiv.2403.17709,
title = {Groupwise Query Specialization and Quality-Aware Multi-Assignment for Transformer-based Visual Relationship Detection},
author = {Jongha Kim and Jihwan Park and Jinyoung Park and Jinyoung Kim and Sehyung Kim and Hyunwoo J. Kim},
journal= {arXiv preprint arXiv:2403.17709},
year = {2024}
}
备注
CVPR 2024