中文

融合目标感知与交互感知知识的弱监督场景图生成

计算机视觉与模式识别 2022-08-04 v1

摘要

近年来,越来越多的研究致力于弱监督场景图生成(WSSGG)。WSSGG的主流解决方案通常遵循相同的流程:首先将弱图像级监督(如未定位的关系三元组或图像描述)中的文本实体与图像区域对齐,然后利用对齐后的实例级“伪”标签以全监督方式训练SGG模型。然而,我们认为大多数现有WSSGG工作仅关注目标一致性,即接地区域应具有与文本实体相同的目标类别标签,而忽略了理想对齐的另一基本需求:交互一致性,即接地区域对应具有与文本实体对相同的交互(即视觉关系)。因此,本文提出以一个简易的接地模块为基础,引入目标感知与交互感知两类知识以获取更可靠的伪标签。为更好地利用这两类知识,我们将它们视为两位教师,并融合其生成的监督目标来引导接地模块的训练过程。具体而言,我们设计了两种不同的策略,通过评估各教师在每个训练样本上的可靠性,自适应地为不同教师分配权重。大量实验表明,我们的方法在各种弱监督条件下均能持续提升WSSGG性能。

关键词

引用

@article{arxiv.2208.01834,
  title  = {Integrating Object-aware and Interaction-aware Knowledge for Weakly Supervised Scene Graph Generation},
  author = {Xingchen Li and Long Chen and Wenbo Ma and Yi Yang and Jun Xiao},
  journal= {arXiv preprint arXiv:2208.01834},
  year   = {2022}
}