中文

面向场景图生成的语义歧义概率建模

计算机视觉与模式识别 2021-03-11 v2

摘要

为了生成“准确”的场景图,几乎所有现有方法都以确定性方式预测成对关系。然而,我们认为视觉关系常常存在语义歧义。具体而言,受语言学知识启发,我们将歧义分为三类:同义歧义、上下位歧义与多视角歧义。这种歧义自然导致了隐式多标签问题,从而产生了对多样化预测的需求。本工作中,我们提出一种新颖的即插即用概率不确定性建模(Probabilistic Uncertainty Modeling, PUM)模块。它将每个联合区域建模为高斯分布,其方差度量对应视觉内容的不确定性。与传统的确定性方法相比,这种不确定性建模带来了特征表示的随机性,从而自然地支持多样化预测。作为副产品,PUM 还能覆盖更细粒度的关系,从而缓解对频繁关系的偏置问题。在大规模 Visual Genome 基准上的大量实验表明,将 PUM 与新提出的 ResCAGCN 结合可取得最先进的性能,尤其在平均召回率指标下。此外,我们将 PUM 插入若干现有模型中证明了其通用有效性,并就其生成多样且合理视觉关系的能力提供了深入分析。

关键词

引用

@article{arxiv.2103.05271,
  title  = {Probabilistic Modeling of Semantic Ambiguity for Scene Graph Generation},
  author = {Gengcong Yang and Jingyi Zhang and Yong Zhang and Baoyuan Wu and Yujiu Yang},
  journal= {arXiv preprint arXiv:2103.05271},
  year   = {2021}
}

备注

CVPR 2021 poster