度量图像-关系对齐:VLM 的无参考评估与面向开放词表场景图生成的合成预训练
计算机视觉与模式识别
2025-09-03 v1
摘要
场景图生成 (Scene Graph Generation, SGG) 将图像中物体之间的视觉关系编码为图结构。得益于视觉语言模型 (Vision-Language Models, VLMs) 的进步,开放词表 SGG 任务最近被提出,在该任务中通过评估模型学习广泛且多样关系的能力来衡量模型性能。然而,当前的 SGG 基准测试词表非常有限,使得对开源模型的评估效率低下。在本文中,我们提出了一种新的无参考度量标准,以公平地评估 VLM 在关系预测中的开放词表能力。开放词表 SGG 的另一个局限是依赖于质量较差的弱监督数据进行预训练。我们还提出了一种新方法,通过对 VLM 进行特定区域的提示微调来快速生成高质量的合成数据。实验结果表明,使用这一新数据划分进行预训练可以提升开放词表 SGG 模型的泛化能力。
引用
@article{arxiv.2509.01209,
title = {Measuring Image-Relation Alignment: Reference-Free Evaluation of VLMs and Synthetic Pre-training for Open-Vocabulary Scene Graph Generation},
author = {Maëlic Neau and Zoe Falomir and Cédric Buche and Akihiro Sugimoto},
journal= {arXiv preprint arXiv:2509.01209},
year = {2025}
}