SCENIR:基于无监督场景图检索的视觉语义清晰度
计算机视觉与模式识别
2025-05-23 v1 机器学习
摘要
尽管卷积和变换器架构在图像到图像检索中占据主导地位,这些模型容易受到来自低级视觉特征(如颜色)的偏见的影响。鉴于缺乏语义理解是关键限制因素,我们提出了一种新颖的场景图检索框架,强调语义内容而非浅显的图像特征。以往的场景图检索方法主要依赖于监督式图神经网络(GNN),这些网络需要来自图像标题的 ground truth graph pairs 驱动。然而,基于标题的监督方式由于可变的文本编码而不可靠。为此,我们提出SCENIR,一种基于图自编码器的无监督检索框架,消除了对标注训练数据的依赖。我们的模型在各项指标和运行效率方面均表现出优异性能,超过了现有的基于视觉的、多模态的和监督式 GNN 方法。我们进一步主张将图编辑距离(GED)作为一种确定性和稳健的场景图相似度 ground truth measure,首次在图像到图像检索评估中取代不一致的基于标题的替代方案。最后,我们通过将其应用于未标注数据集的自动化场景图生成来验证了方法的通用性,同时在推进对抗图像检索的 SOTA 方面作出了 substantial 贡献。
引用
@article{arxiv.2505.15867,
title = {SCENIR: Visual Semantic Clarity through Unsupervised Scene Graph Retrieval},
author = {Nikolaos Chaidos and Angeliki Dimitriou and Maria Lymperaiou and Giorgos Stamou},
journal= {arXiv preprint arXiv:2505.15867},
year = {2025}
}