中文

SADGE:合成与真实数据结构与外观域间差距估计

计算机视觉与模式识别 2026-05-22 v1

摘要

我们提出 SADGE,一种用于预测合成图像数据集在常见计算机视觉任务中性能的定量相似度度量标准。估计合成数据集是否会导致在真实数据上表现良好的模型,仍是模型开发中的瓶颈。现有评估指标(如 PSNR、FID、CLIP)主要衡量真实图像与合成图像之间的语义对齐(外观相似度评分),而较少考虑图像之间的结构相似性以评估域间差距(几何相似度评分)。然而,据我们所知,尚无研究评估哪种相似度度量是给定合成数据集的最佳下游预测器。在本文中,我们在广泛的不同合成数据集和下游任务上表明,仅靠外观或几何因素无法可靠预测下游性能,真正决定合成数据实用性的是它们之间非线性的相互作用。具体而言,我们衡量常用的外观与几何相似度指标在合成与真实图像之间的相关性,并评估其在目标检测、语义分割和姿态估计中的下游性能。我们在五大公开合成到真实基准族中测试,涵盖 15 个数据集层级变体(共 79,000 张图像对),SADGE 在线性和秩相关标准下均实现最强的下游迁移性能,分别达到 Pearson r=0.88 和 Spearman rho=0.77。我们计算了几何方法与外观方法的所有组合的 SADGE 分数。最佳配置通过受限双线性交互融合 DINOv3 外观相似度与 MASt3R 几何一致性,超越了最强的几何单一基线和最强的外观单一基线。

关键词

引用

@article{arxiv.2605.22467,
  title  = {SADGE: Structure and Appearance Domain Gap Estimation of Synthetic and Real Data},
  author = {Patryk Bartkowiak and Bartosz Kotrys and Dominik Michels and Soren Pirk and Wojtek Palubicki},
  journal= {arXiv preprint arXiv:2605.22467},
  year   = {2026}
}