中文

RepSGG:面向场景图生成的实体与关系新颖表示

计算机视觉与模式识别 2023-09-08 v1

摘要

场景图生成(SGG)近期取得了显著进展。然而,大多数先前工作严重依赖基于边界框提议、锚点或可学习查询的固定大小实体表示。由于每种表示的基数在性能与计算开销之间存在不同权衡,高效且动态地提取高代表性特征对SGG而言既具挑战又至关重要。本工作提出一种称为RepSGG的新颖架构以应对上述挑战,将主体表述为查询、客体表述为键,并将其关系表述为成对查询与键之间的最大注意力权重。凭借对实体和关系更细粒度且灵活的表示能力,RepSGG学习采样语义可区分且具代表性的点用于关系推断。此外,长尾分布也给SGG的泛化带来重大挑战。本文提出一种运行时性能引导的logit调整(PGLA)策略,使得关系logits在训练期间通过基于运行时性能的仿射变换被修改。该策略鼓励主导类与稀有类之间更均衡的性能。实验结果表明,RepSGG在Visual Genome和Open Images V6数据集上以快速推理速度取得了最先进或可比的性能,证明了所提方法的有效性与高效性。

关键词

引用

@article{arxiv.2309.03240,
  title  = {RepSGG: Novel Representations of Entities and Relationships for Scene Graph Generation},
  author = {Hengyue Liu and Bir Bhanu},
  journal= {arXiv preprint arXiv:2309.03240},
  year   = {2023}
}