中文

EasyText:用于多语言文本渲染的可控 Diffusion Transformer

计算机视觉与模式识别 2026-03-11 v2

摘要

利用扩散模型生成准确的多语言文本一直备受期待,但仍然充满挑战。近期方法在单语言文本渲染方面取得了进展,但渲染任意语言仍是一个未被探索的领域。本文提出了 EasyText,一个基于 DiT (Diffusion Transformer) 的文本渲染框架,该框架将去噪隐变量与编码为字符 token 的多语言字符 token 相连接。我们提出了字符定位编码和位置编码插值技术,以实现可控且精确的文本渲染。此外,我们构建了一个包含 100 万张多语言图文标注的大规模合成文本图像数据集,以及一个包含 2 万张标注图像的高质量数据集,分别用于预训练和微调。大量实验与评估表明,我们的方法在多语言文本渲染、视觉质量和布局感知的文本融合方面的有效性与先进性。

关键词

引用

@article{arxiv.2505.24417,
  title  = {EasyText: Controllable Diffusion Transformer for Multilingual Text Rendering},
  author = {Runnan Lu and Yuxuan Zhang and Jiaming Liu and Haofan Wang and Yiren Song},
  journal= {arXiv preprint arXiv:2505.24417},
  year   = {2026}
}