中文

Illustrious:一种开源高级插画模型

计算机视觉与模式识别 2024-10-01 v1

摘要

本文分享我们在实现文本到动漫图像生成模型——Illustrious 的最高质量方面的洞见。为实现高分辨率、动态颜色范围图像以及高恢复能力,我们聚焦于三项关键方法进行模型改进。首先,我们深入探讨了批量大小和 dropout 控制的重要性,这使模型能够更快地学习基于可控 token 的概念激活。其次,我们增加了图像的训练分辨率,这影响了在更高分辨率下准确描绘人物解剖结构,扩展了其超过 20MP 的生成能力。最后,我们提出了精细化的多级标题,涵盖所有标签和各种自然语言标题,这是模型开发的关键因素。通过广泛的分析和实验,Illustrious 在动画风格方面表现出领先水平,超越插画领域中广泛使用的模型,推动了更容易的定制和个性化,凭借开源特性。我们计划逐步公开发布更新的 Illustrious 模型系列,并制定持续的改进计划。

关键词

引用

@article{arxiv.2409.19946,
  title  = {Illustrious: an Open Advanced Illustration Model},
  author = {Sang Hyun Park and Jun Young Koh and Junha Lee and Joy Song and Dongha Kim and Hoyeon Moon and Hyunju Lee and Min Song},
  journal= {arXiv preprint arXiv:2409.19946},
  year   = {2024}
}