中文

FonTS:基于字体与风格控制的文本渲染

计算机视觉与模式识别 2025-07-14 v3 人工智能 机器学习

摘要

视觉文本渲染在 various 实际应用场景中广泛应用,需仔细选择字体并进行排版设计。最近在基于扩散转换器(DiT)的文本到图像(T2I)模型方面取得了进展,正在为自动化这些过程提供前景。然而,这些方法仍面临字体不一致、风格变化以及在单词级别上受限的细粒度控制等挑战。本文提出了一个基于两个阶段的 DiT 流程,以增强对文本渲染中排版和风格的可控性来解决这些问题。我们引入了排版控制微调(TC-FT),这是一种参数高效的微调方法(仅使用 5%5\% 的关键参数),配合包裹排版控制标记(ETC-tokens),从而实现对排版特征的精确单词级应用。为进一步解决文本渲染中的风格不一致问题,我们提出了一种文本无关的风格控制适配器(SCA),可防止内容泄漏并增强风格一致性。为有效实现 TC-FT 和 SCA,我们将 HTML 渲染纳入数据合成管道,并提出了首个可控制的单词级数据集。通过大量实验,我们展示了该方法在实现文本渲染任务中卓越的单词级排版控制、字体一致性和风格一致性方面的有效性。该数据集和模型将提供给学术界使用。

关键词

引用

@article{arxiv.2412.00136,
  title  = {FonTS: Text Rendering with Typography and Style Controls},
  author = {Wenda Shi and Yiren Song and Dengming Zhang and Jiaming Liu and Xingxing Zou},
  journal= {arXiv preprint arXiv:2412.00136},
  year   = {2025}
}

备注

Accepted to ICCV 2025