FontDiffuser:基于多尺度内容聚合与风格对比学习去噪扩散的单样本字体生成
计算机视觉与模式识别
2023-12-20 v1 人工智能
摘要
自动字体生成是一项模仿任务,旨在创建一个字体库,该字体库在保持源图像内容的同时模仿参考图像的风格。尽管现有的字体生成方法已取得令人满意的性能,但在处理复杂字符和较大风格变化时仍存在困难。为了解决这些问题,我们提出了 FontDiffuser,一种基于扩散的图像到图像单样本字体生成方法,该方法创新地将字体模仿任务建模为噪声到去噪的范式。在我们的方法中,我们引入了多尺度内容聚合 (MCA) 模块,该模块有效地结合了不同尺度的全局和局部内容线索,从而增强了对复杂字符复杂笔画的保留。此外,为了更好地处理风格迁移中的巨大变化,我们提出了风格对比细化 (SCR) 模块,这是一种用于风格表示学习的新型结构。它利用风格提取器从图像中解耦风格,随后通过精心设计的风格对比损失来监督扩散模型。大量实验表明,FontDiffuser 在生成多样化字符和风格方面达到了 SOTA 性能。与以往方法相比,它在复杂字符和较大风格变化上始终表现出色。代码可在 https://github.com/yeungchenwa/FontDiffuser 获取。
引用
@article{arxiv.2312.12142,
title = {FontDiffuser: One-Shot Font Generation via Denoising Diffusion with Multi-Scale Content Aggregation and Style Contrastive Learning},
author = {Zhenhua Yang and Dezhi Peng and Yuxin Kong and Yuyi Zhang and Cong Yao and Lianwen Jin},
journal= {arXiv preprint arXiv:2312.12142},
year = {2023}
}
备注
Accepted to AAAI 2024; Github Page: https://github.com/yeungchenwa/FontDiffuser