中文

DiffDoctor:在治疗前诊断图像扩散模型

计算机视觉与模式识别 2025-03-12 v2

摘要

尽管近期取得了进展,图像扩散模型仍会产生artifacts。常见解决方案是利用质量评估系统或人类标注员提供的反馈来优化模型,其中图像通常以整体方式进行评级。在本 work 中,我们认为问题的解决始于识别,因而要求模型不仅要意识到图像中是否存在缺陷,还要意识到这些缺陷的具体位置。为此,我们提出了 DiffDoctor,一个两阶段管道,用于帮助图像扩散模型生成更少的 artifacts。具体而言,第一阶段旨在开发稳健的缺陷检测器,为此我们收集了超过 100 万张 flawed 合成图像的数据集,并设置高效的人类在环标注流程,包含仔细设计的类别平衡策略。所学得的缺陷检测器随后参与第二阶段,通过提供像素级反馈来优化扩散模型。对文本到图像扩散模型进行大量实验表明,我们的缺陷检测器有效且我们的诊断-治疗设计合理。

关键词

引用

@article{arxiv.2501.12382,
  title  = {DiffDoctor: Diagnosing Image Diffusion Models Before Treating},
  author = {Yiyang Wang and Xi Chen and Xiaogang Xu and Sihui Ji and Yu Liu and Yujun Shen and Hengshuang Zhao},
  journal= {arXiv preprint arXiv:2501.12382},
  year   = {2025}
}

备注

8 pages of main body