GRIF-DM: 基于扩散模型的丰富印象字体生成
计算机视觉与模式识别
2024-08-15 v1 人工智能
摘要
字体是创意工作、设计流程和艺术创作的重要组成部分。合适的字体选择可以显著增强艺术作品的表现力,并为广告赋予更高的表达性。尽管网上有大量不同的字体设计可供选择,但传统的基于检索的字体选择方法正逐渐被基于生成的方法所取代。这些新方法提供了更高的灵活性,能够满足特定的用户偏好并捕捉独特的风格印象。然而,当前基于生成对抗网络(GAN)的印象字体方法需要利用多个辅助损失来为生成过程提供指导。此外,这些方法通常采用加权求和的方式来融合印象相关关键词,这导致在增加更多印象关键词时生成通用向量,最终缺乏细节生成能力。在本文中,我们提出了一种基于扩散的方法——GRIF-DM,通过输入单个字母和一组描述性印象关键词来生成生动体现特定印象的字体。GRIF-DM的核心创新在于开发了双交叉注意力模块,分别但协同地处理字母特征和印象关键词特征,确保两类信息的有效整合。我们在 MyFonts 数据集上的实验结果证实,该方法能够生成与用户规格高度匹配的、逼真的、生动的且高保真的字体。这证实了我们的方法在适应广泛的用户驱动设计需求方面革新字体生成的潜力。我们的代码公开获取于 \url{https://github.com/leitro/GRIF-DM}。
引用
@article{arxiv.2408.07259,
title = {GRIF-DM: Generation of Rich Impression Fonts using Diffusion Models},
author = {Lei Kang and Fei Yang and Kai Wang and Mohamed Ali Souibgui and Lluis Gomez and Alicia Fornés and Ernest Valveny and Dimosthenis Karatzas},
journal= {arXiv preprint arXiv:2408.07259},
year = {2024}
}
备注
Accepted to ECAI2024