中文

面向零样本开放词汇任务的谓词丰富场景图生成框架 PRISM-0

计算机视觉与模式识别 2025-11-18 v2 机器学习

摘要

在场景图生成(SGG)中,结构化表示从视觉输入中提取为对象节点和连接谓词,使图像基于推理能够支持多样化的下游任务。虽然完全监督的SGG取得了 steady 进步,但由于受限于数据和长尾谓词分布,存在训练偏差,导致谓词多样性差、下游性能下降。我们提出PRISM-0,一个零样本开放词汇SGG框架,利用基础模型在自下而上管道中捕捉广泛谓词谱系。检测到的对象对被过滤,经视觉语言模型(VLM)描述,随后由大型语言模型(LLM)生成细粒度和粗粒度谓词,然后由视觉问答(VQA)模型进行验证。PRISM-0模块化、数据无关的设计丰富了现有SGG数据集如Visual Genome,产生多样且无偏见的图。虽然完全以零样本方式运行,PRISM-0在SGG基准测试中达到与最先进的弱监督模型相当的性能,甚至在句子到图检索等任务中超越最先进的监督方法。

关键词

引用

@article{arxiv.2504.00844,
  title  = {PRISM-0: A Predicate-Rich Scene Graph Generation Framework for Zero-Shot Open-Vocabulary Tasks},
  author = {Abdelrahman Elskhawy and Mengze Li and Nassir Navab and Benjamin Busam},
  journal= {arXiv preprint arXiv:2504.00844},
  year   = {2025}
}