中文

Mind-the-Glitch:用于检测主体驱动生成中不一致性的视觉对应

计算机视觉与模式识别 2025-09-29 v1

摘要

我们提出了一种从预训练扩散模型主干网络中解耦视觉与语义特征的新方法,使得视觉对应能够以类似于成熟的语义对应的方式实现。虽然已知扩散模型主干网络编码了语义丰富的特征,但它们也必须包含视觉特征以支持其图像合成能力。然而,由于缺乏标注数据集,分离这些视觉特征具有挑战性。为了解决这一问题,我们引入了一个自动化流程,基于现有的主体驱动图像生成数据集构建具有标注语义和视觉对应的图像对,并设计了一种对比架构来分离这两类特征。利用解耦的表示,我们提出了一种新指标——视觉语义匹配(VSM),用于量化主体驱动图像生成中的视觉不一致性。实证结果表明,我们的方法在量化视觉不一致性方面优于基于全局特征的指标(如 CLIP、DINO 和视觉-语言模型),同时还能实现不一致区域的空间定位。据我们所知,这是首个支持在主体驱动生成中同时进行不一致性量化和定位的方法,为推进该任务提供了有价值的工具。项目页面:https://abdo-eldesokey.github.io/mind-the-glitch/

关键词

引用

@article{arxiv.2509.21989,
  title  = {Mind-the-Glitch: Visual Correspondence for Detecting Inconsistencies in Subject-Driven Generation},
  author = {Abdelrahman Eldesokey and Aleksandar Cvejic and Bernard Ghanem and Peter Wonka},
  journal= {arXiv preprint arXiv:2509.21989},
  year   = {2025}
}

备注

NeurIPS 2025 (Spotlight). Project Page: https://abdo-eldesokey.github.io/mind-the-glitch/