SPAN:用 Transformer 学习场景图与图像间的相似性
计算机视觉与模式识别
2024-05-21 v2
摘要
学习场景图与图像之间的相似性旨在给定场景图与图像时估计相似度分数。尽管该任务对场景图生成及下游应用至关重要,目前尚无专门研究。场景图生成传统上以 Recall 和 mean Recall 评估,其衡量出现在人工标注三元组集合中的预测三元组比例。然而,此类面向三元组的指标无法展现场景图与图像间的整体语义差异,且对标注偏差与噪声敏感。因此在下游应用中使用生成的场景图受到限制。为解决此问题,我们首次提出场景图-图像对比学习框架 SPAN,可度量场景图与图像间的相似性。我们的新颖框架由图 Transformer 与图像 Transformer 组成,以在共享潜空间中对齐场景图及其对应图像。我们引入一种新颖的图序列化技术,将场景图转化为带结构编码的序列。基于该框架,我们提出以衡量图像检索精度的 R-Precision 作为场景图生成的新评估指标。我们在 Visual Genome 与 Open Images 数据集上建立了新基准。大量实验验证了 SPAN 的有效性,其作为场景图编码器展现出巨大潜力。
引用
@article{arxiv.2304.00590,
title = {SPAN: Learning Similarity between Scene Graphs and Images with Transformers},
author = {Yuren Cong and Wentong Liao and Bodo Rosenhahn and Michael Ying Yang},
journal= {arXiv preprint arXiv:2304.00590},
year = {2024}
}