中文

用于少样本场景图生成的分解原型学习

计算机视觉与模式识别 2024-12-30 v2

摘要

当前的场景图生成(SGG)模型通常需要大量人工标注来学习新的谓词类型。因此,难以将它们应用于具有大量不常见谓词类别的真实应用,这些类别的标注难以收集。在本文中,我们关注少样本 SGG(FSSGG),其旨在使 SGG 模型能够利用仅少量样本快速迁移已有知识并良好识别未见谓词。然而,当前 FSSGG 方法受限于 SGG 中谓词类别的高类内方差:一方面,每个谓词类别在不同上下文下通常具有多种语义含义;另一方面,具有相同谓词的关系三元组在不同主-客体组合下视觉外观差异巨大。这种巨大的输入方差使得利用当前少样本学习(FSL)方法难以学习每个谓词类别的可泛化表示。然而,我们发现谓词的类内方差与主客体上下文高度相关。为建模谓词随主客体上下文的类内方差,我们提出了一种用于 FSSGG 的新颖分解原型学习(DPL)模型。具体而言,我们首先构建一个可分解原型空间,通过将谓词分解多个原型来捕捉主客体多样语义与视觉模式;随后,我们以不同权重整合这些原型,为每个查询样本生成具有更可靠语义的查询自适应谓词表示。我们进行了充分实验并与多种基线方法比较,以展示我们方法的有效性。

关键词

引用

@article{arxiv.2303.10863,
  title  = {Decomposed Prototype Learning for Few-Shot Scene Graph Generation},
  author = {Xingchen Li and Jun Xiao and Guikun Chen and Yinfu Feng and Yi Yang and An-an Liu and Long Chen},
  journal= {arXiv preprint arXiv:2303.10863},
  year   = {2024}
}