中文

FontAdapter:视觉文本生成中的即时字体适配

计算机视觉与模式识别 2025-06-09 v1

摘要

文本到图像扩散模型显著提升了将视觉文本无缝集成到多样化图像上下文中的能力。近期方法通过使用预定义字体词典进行微调,以进一步提高对字体样式的控制。然而,适应预设之外的未见字体计算成本高昂,往往需要数十分钟,使得实时定制变得不可行。本文提出FontAdapter框架,使其能够在数秒内,基于参考字形图像,实现未见字体的视觉文本生成。为此,我们发现,直接在字体数据集上训练无法捕获细微的字体属性,从而限制了对新字形的泛化。为克服这一困难,我们提出两种课程学习方法:FontAdapter首先学习从孤立字形中提取字体属性,然后将这些样式整合到多样化的自然背景中。为支持这种两种训练阶段,我们针对每个阶段构建了量身定制的合成数据集,有效地利用大规模在线字体资源。实验表明,FontAdapter能够在推理期间无需额外微调,实现对未见字体的高质量、稳健的字体定制。此外,它支持视觉文本编辑、字体样式混合以及跨语言字体迁移,将FontAdapter定位为字体定制任务的通用框架。

关键词

引用

@article{arxiv.2506.05843,
  title  = {FontAdapter: Instant Font Adaptation in Visual Text Generation},
  author = {Myungkyu Koo and Subin Kim and Sangkyung Kwak and Jaehyun Nam and Seojin Kim and Jinwoo Shin},
  journal= {arXiv preprint arXiv:2506.05843},
  year   = {2025}
}

备注

Project page: https://fontadapter.github.io/