中文

基于角色扮演大语言模型的场景图生成

计算机视觉与模式识别 2024-10-22 v1 多媒体

摘要

当前用于开放词汇场景图生成(OVSGG)的方法使用视觉语言模型如 CLIP,并遵循标准的零样验证管线——计算查询图像与每个类别(即文本分类器)文本嵌入之间的相似度。在本工作中,我们认为现有 OVSGG 方法所采用的数据集/部件水平提示是场景不可知的,因为它们在不同语境下保持不变。使用此类固定文本分类器不仅难以高方差建模视觉关系,而且在适应不同语境方面也不足。为弥补这些固有的局限性,我们设计了 SDSGG(基于场景特定描述的 OVSGG 框架),其中文本分类器的权重根据视觉内容进行自适应调整。具体而言,通过要求 LLM 扮演不同角色(如生物学家和工程师),来分析和讨论给定场景的描述特征,从不同视角生成全面且多样的描述。与之前的做法 simply 将生成的描述视为等价文本分类器不同,SDSGG 配备了先进的重新归一化机制,根据其与所呈现场景的相关性调整每个文本分类器的影响(这正是“specific”一词含义的所在)。此外,为捕捉主体与客体之间复杂的相互作用,我们提出了一种新的轻量级模块,称为互动视觉适配器。它通过学习一种交互感知语义空间来细化 CLIP 识别关系的能力。大量实验表明,SDSGG 在主流基准数据集上显著优于顶尖方法。

关键词

引用

@article{arxiv.2410.15364,
  title  = {Scene Graph Generation with Role-Playing Large Language Models},
  author = {Guikun Chen and Jin Li and Wenguan Wang},
  journal= {arXiv preprint arXiv:2410.15364},
  year   = {2024}
}

备注

NeurIPS 2024. Code: https://github.com/guikunchen/SDSGG