中文

量化扩散模型图像生成一致性的语义方法

计算机视觉与模式识别 2024-04-16 v1 人工智能 人机交互 机器学习

摘要

在这项研究中,我们确定了对扩散模型中图像生成的可重复性或一致性的可解释定量分数的需求。我们提出了一种语义方法,使用成对平均CLIP(对比语言-图像预训练)分数作为我们的语义一致性分数。我们将此指标应用于比较两个最先进的开源图像生成扩散模型,Stable Diffusion XL和PixArt-α,并发现模型之间的语义一致性分数存在统计显著差异。语义一致性分数选择的模型与聚合的人类注释之间的一致性为94%。我们还探索了SDXL和LoRA微调版本的SDXL的一致性,发现微调模型在生成图像中具有显著更高的语义一致性。这里提出的语义一致性分数提供了一种图像生成对齐的度量,有助于评估特定任务的模型架构,并帮助做出关于模型选择的明智决策。

关键词

引用

@article{arxiv.2404.08799,
  title  = {Semantic Approach to Quantifying the Consistency of Diffusion Model Image Generation},
  author = {Brinnae Bent},
  journal= {arXiv preprint arXiv:2404.08799},
  year   = {2024}
}

备注

Accepted to 2024 CVPR 3rd Explainable AI for Computer Vision (XAI4CV) Workshop