中文

面向风格图标生成的Stable Diffusion XL微调: caption 大小比较

计算机视觉与模式识别 2024-07-16 v2

摘要

本文展示了针对Stable Diffusion XL的不同微调方法,包括推理步骤和为每张图像定制的 caption,以匹配来自商业2D图标训练集的图像风格。我们还说明了在商业环境中正确定义“高质量”的重要性。随着生成式AI模型广泛接受和使用,出现了多种优化和评估方法。特别是,文本到图像模型如Stable Diffusion XL和DALL-E 3 需要不同于常规方法的评估实践,以有效生成符合特定风格的高质量图标。尽管基于特定风格生成的部分图像可能获得较低的FID分数(更好),但我们指出这并非绝对,尤其对于光栅化图标而言。FID分数反映生成图像与整个训练集的相似性,而CLIP分数衡量生成图像与其文本描述的对齐程度。我们展示了FID分数忽略了一类关键因素——图标中少数关键像素差异,而CLIP分数则因其对“相似性”的理解受限于训练数据,未能覆盖所选风格的特征变异。我们的发现凸显在生成高质量商业图标时,需采用专门的评估指标和微调方法, potentially 引领文本到图像模型在专业设计情境中更有效、更定制化的应用。

关键词

引用

@article{arxiv.2407.08513,
  title  = {Fine-Tuning Stable Diffusion XL for Stylistic Icon Generation: A Comparison of Caption Size},
  author = {Youssef Sultan and Jiangqin Ma and Yu-Ying Liao},
  journal= {arXiv preprint arXiv:2407.08513},
  year   = {2024}
}

备注

11 pages, 22 figures