中文

RA-SGG:基于多原型学习的检索增强场景图生成框架

计算机视觉与模式识别 2024-12-18 v1

摘要

场景图生成(SGG)研究长期受两个根本性挑战的困扰:谓词分布的长尾性和谓词间的语义歧义。这些挑战导致 SGG 模型偏向头部谓词,倾向于主导性的通用谓词而忽略细粒度谓词。在本文中,我们通过将 SGG 建构为带有部分标注的多标签分类问题来解决其面临的挑战,其中细粒度谓词的相关标签是缺失的。在这一新框架下,我们提出了检索增强场景图生成(RA-SGG),其通过从我们构建的记忆库中检索相关样本,识别出潜在的多标签实例,并用与原始标签语义相似的多标签来丰富单标签。基于增强的关系(即发现的多标签),我们应用多原型学习来训练我们的 SGG 模型。多项综合实验表明,RA-SGG 在 VG 和 GQA 上分别比 state-of-the-art 基线高出最多 3.6% 和 5.9%,特别是在 F@K 指标上表现突出,这表明 RA-SGG 有效缓解了由谓词长尾分布和语义歧义引起的预测偏差问题。

关键词

引用

@article{arxiv.2412.12788,
  title  = {RA-SGG: Retrieval-Augmented Scene Graph Generation Framework via Multi-Prototype Learning},
  author = {Kanghoon Yoon and Kibum Kim and Jaehyung Jeon and Yeonjun In and Donghyun Kim and Chanyoung Park},
  journal= {arXiv preprint arXiv:2412.12788},
  year   = {2024}
}

备注

7 pages