中文

面向开放词汇场景图生成的关系感知层次化提示

计算机视觉与模式识别 2025-07-15 v2 人工智能

摘要

开放词汇场景图生成(OV-SGG)通过将视觉关系表示与开放词汇文本表示对齐,克服了封闭集假设的限制。这使得能够识别新出现的视觉关系,使其适用于多样化关系的实际场景。然而,现有的 OV-SGG 方法受限于固定的文本表示,限制了图像-文本对齐的多样性和准确性。为此,我们提出了关系感知层次化提示(RAHP)框架,通过整合主体-客体和区域特定关系信息来增强文本表示。我们的方法利用实体聚类来解决关系三元组类别的复杂性,从而有效整合主体-客体信息。此外,我们利用大型语言模型(LLM)生成详细的区域感知提示,捕捉细粒度的视觉互动,提高视觉与文本模态之间的对齐。RAHP 还在视觉-语言模型(VLMs)中引入动态选择机制,根据视觉内容自适应选择相关文本提示,减少无关提示的噪声。在 Visual Genome 和 Open Images v6 数据集上的大量实验表明,我们的框架始终实现了最先进的性能,证明了其在解决开放词汇场景图生成挑战方面的有效性。代码可在 https://github.com/Leon022/RAHP 获取。

关键词

引用

@article{arxiv.2412.19021,
  title  = {Relation-aware Hierarchical Prompt for Open-vocabulary Scene Graph Generation},
  author = {Tao Liu and Rongjie Li and Chongyu Wang and Xuming He},
  journal= {arXiv preprint arXiv:2412.19021},
  year   = {2025}
}

备注

Accepted by AAAI-25