面向开放词汇场景图生成的关系感知层次化提示
计算机视觉与模式识别
2025-07-15 v2 人工智能
摘要
开放词汇场景图生成(OV-SGG)通过将视觉关系表示与开放词汇文本表示对齐,克服了封闭集假设的限制。这使得能够识别新出现的视觉关系,使其适用于多样化关系的实际场景。然而,现有的 OV-SGG 方法受限于固定的文本表示,限制了图像-文本对齐的多样性和准确性。为此,我们提出了关系感知层次化提示(RAHP)框架,通过整合主体-客体和区域特定关系信息来增强文本表示。我们的方法利用实体聚类来解决关系三元组类别的复杂性,从而有效整合主体-客体信息。此外,我们利用大型语言模型(LLM)生成详细的区域感知提示,捕捉细粒度的视觉互动,提高视觉与文本模态之间的对齐。RAHP 还在视觉-语言模型(VLMs)中引入动态选择机制,根据视觉内容自适应选择相关文本提示,减少无关提示的噪声。在 Visual Genome 和 Open Images v6 数据集上的大量实验表明,我们的框架始终实现了最先进的性能,证明了其在解决开放词汇场景图生成挑战方面的有效性。代码可在 https://github.com/Leon022/RAHP 获取。
引用
@article{arxiv.2412.19021,
title = {Relation-aware Hierarchical Prompt for Open-vocabulary Scene Graph Generation},
author = {Tao Liu and Rongjie Li and Chongyu Wang and Xuming He},
journal= {arXiv preprint arXiv:2412.19021},
year = {2025}
}
备注
Accepted by AAAI-25