中文

基于原型的嵌入网络用于场景图生成

计算机视觉与模式识别 2023-03-14 v1

摘要

当前的场景图生成(SGG)方法利用上下文信息来预测实体对之间的关系。然而,由于大量可能的主体-客体组合具有多样的视觉外观,在每个谓词类别中存在较大的类内差异(例如“man-eating-pizza、giraffe-eating-leaf”),且不同类别之间存在严重的类间相似性(例如“man-holding-plate、man-eating-pizza”),这体现在模型的潜空间中。上述挑战阻碍了当前 SGG 方法获取用于可靠关系预测的鲁棒特征。在本文中,我们提出谓词的类别固有语义可作为语义空间中的类级原型,以缓解这些挑战。为此,我们提出了基于原型的嵌入网络(PE-Net),该网络以原型对齐的紧凑且具区分性的表示对实体/谓词建模,从而在公共嵌入空间中建立实体对与谓词之间的匹配以进行关系识别。此外,引入了原型引导学习(PL)以帮助 PE-Net 高效学习此种实体-谓词匹配,并设计了原型正则化(PR)以缓解由谓词语义重叠引起的模糊实体-谓词匹配。大量实验表明,我们的方法在 SGG 上获得了优越的关系识别能力,在 Visual Genome 和 Open Images 数据集上均取得了新的 SOTA 性能。

关键词

引用

@article{arxiv.2303.07096,
  title  = {Prototype-based Embedding Network for Scene Graph Generation},
  author = {Chaofan Zheng and Xinyu Lyu and Lianli Gao and Bo Dai and Jingkuan Song},
  journal= {arXiv preprint arXiv:2303.07096},
  year   = {2023}
}

备注

Accepted by CVPR 2023