中文

从一般到具体:基于平衡调整的信息化场景图生成

计算机视觉与模式识别 2021-08-31 v1

摘要

场景图生成(SGG)任务旨在检测图像中的视觉关系三元组,即主体、谓词、客体,为场景理解提供结构化的视觉布局。然而,当前模型困于常见谓词(如“on”和“at”),而非信息化谓词(如“standing on”和“looking at”),导致精确信息及整体性能的丢失。若模型仅用“stone on road”而非“blocking”来描述图像,则容易误解场景。我们认为该现象由信息化谓词与常见谓词之间的两个关键不平衡所致,即语义空间层面的不平衡与训练样本层面的不平衡。为解决此问题,我们提出 BA-SGG,一种基于平衡调整而非传统分布拟合的简单而有效的 SGG 框架。它集成两个组件:语义调整(SA)与平衡谓词学习(BPL),分别用于调整上述不平衡。得益于模型无关的处理过程,我们的方法易于应用于最先进的 SGG 模型,并显著提升 SGG 性能。在 Visual Genome 上三个场景图生成子任务中,我们的方法分别比 Transformer 模型的平均召回率(mR)高出 14.3%、8.0% 和 6.1%。代码已公开可用。

关键词

引用

@article{arxiv.2108.13129,
  title  = {From General to Specific: Informative Scene Graph Generation via Balance Adjustment},
  author = {Yuyu Guo and Lianli Gao and Xuanhan Wang and Yuxuan Hu and Xing Xu and Xu Lu and Heng Tao Shen and Jingkuan Song},
  journal= {arXiv preprint arXiv:2108.13129},
  year   = {2021}
}