中文

并非所有关系均等价:为场景图生成挖掘信息性标签

计算机视觉与模式识别 2022-04-05 v2

摘要

场景图生成(SGG)旨在捕获物体对之间各种各样的交互,这对于完整的场景理解至关重要。在完整关系集合上训练的现有SGG方法,由于训练数据中的各种偏差,无法获得关于视觉和文本相关性的复杂推理。在表示通用空间配置的平凡关系(如“on”)而非信息性关系(如“parked on”)上进行学习,无法强制执行这种复杂推理,从而损害泛化能力。为了解决这个问题,我们提出了一种新的SGG训练框架,该框架基于关系标签的信息量来利用它们。我们与模型无关的训练过程为训练数据中信息量较少的样本填补缺失的信息性关系,并在填补的标签与现有标注上训练SGG模型。我们表明,该方法可成功与最先进的SGG方法结合使用,并在标准的Visual Genome基准上的多个指标中显著提高其性能。此外,在更具挑战性的零样本设置中,我们对未见三元组获得了可观的改进。

关键词

引用

@article{arxiv.2111.13517,
  title  = {Not All Relations are Equal: Mining Informative Labels for Scene Graph Generation},
  author = {Arushi Goel and Basura Fernando and Frank Keller and Hakan Bilen},
  journal= {arXiv preprint arXiv:2111.13517},
  year   = {2022}
}

备注

16 pages