FontStudio:用于生成连贯且一致字体效果的形状自适应扩散模型
计算机视觉与模式识别
2024-06-13 v1
摘要
最近,利用现代基于扩散的文本到图像生成模型创建艺术字体的应用引起了广泛关注。与大多数现有研究聚焦于生成艺术字体排版不同,本研究旨在解决一个更具挑战性的任务:为多语言字体生成文本效果。这一任务本质上要求在字体形状画布内生成连贯且一致的视觉内容,而不是传统的矩形画布。为此,我们引入一种新型的形状自适应扩散模型,能够解释给定的形状并在不规则画布内战略性地规划像素分布。为实现此目标,我们策划了高质量的形状自适应图像文本数据集,并将分割掩码作为视觉条件纳入,以引导图像在不规则画布内的生成。这种方法使传统基于矩形画布的扩散模型能够按照提供的几何形状生成所需概念。其次,为了维持多个字母之间的一致性,我们还提出了一种无训练的形状自适应效果迁移方法,用于将生成参考字母的纹理传递给其他字母。关键思路在于构建字体效果噪声先验,并在拼接潜在空间中传播字体效果信息。通过用户偏好研究,我们确认了 FontStudio 系统的有效性,其中对我们系统(甚至与最新无与竞争的商业产品 Adobe Firefly 进行比较)的偏好显示出显著优势(在美学方面以 78% 的胜率)。
引用
@article{arxiv.2406.08392,
title = {FontStudio: Shape-Adaptive Diffusion Model for Coherent and Consistent Font Effect Generation},
author = {Xinzhi Mu and Li Chen and Bohan Chen and Shuyang Gu and Jianmin Bao and Dong Chen and Ji Li and Yuhui Yuan},
journal= {arXiv preprint arXiv:2406.08392},
year = {2024}
}
备注
Project-page: https://font-studio.github.io/