中文

DreamSim:利用合成数据学习人类视觉相似性的新维度

计算机视觉与模式识别 2026-05-27 v3 机器学习

摘要

当前的感知相似性度量在像素和图像块层面运作。这些度量从低层颜色与纹理方面比较图像,但未能捕捉图像布局、物体姿态和语义内容上的中层相似性与差异。本文中,我们开发了一种整体评估图像的感知度量。第一步是收集一个新的数据集,包含人类对以多种方式相似的图像对的相似性判断。该数据集的关键在于判断几乎是自动的且为所有观察者所共有。为实现这一点,我们使用近期的文本到图像模型来创建沿不同维度扰动的合成图像对。我们观察到流行的感知度量难以解释我们的新数据,并提出了一种新度量 DreamSim,经调整以更好地与人类感知对齐。我们分析了我们的度量如何受不同视觉属性影响,发现它高度关注前景物体与语义内容,同时对颜色和布局也敏感。值得注意的是,尽管在合成数据上训练,我们的度量能泛化到真实图像,在检索与重建任务上给出强劲结果。此外,在这些任务上,我们的度量优于先前已有的学习度量与近期的大型视觉模型。

关键词

引用

@article{arxiv.2306.09344,
  title  = {DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data},
  author = {Stephanie Fu and Netanel Tamir and Shobhita Sundaram and Lucy Chai and Richard Zhang and Tali Dekel and Phillip Isola},
  journal= {arXiv preprint arXiv:2306.09344},
  year   = {2026}
}

备注

Website: https://dreamsim-nights.github.io/ Code: https://github.com/ssundaram21/dreamsim