FreeText:基于注意力局部化和谱系字形注入的扩散转换器无训练文本渲染
计算机视觉与模式识别
2026-01-05 v1
摘要
大规模文本到图像 (Text-to-Image, T2I) 扩散模型在开放域合成方面表现卓越,但在精确文本渲染(尤其是多行布局、密集排版和长尾脚本如中文)方面仍面临挑战。以往方法通常需要高成本的重新训练或刚性的外部布局约束,这会降低美学效果并限制灵活性。我们提出了 \textbf{FreeText},一个无训练、即插即用的框架,通过利用 \emph{扩散转换器 (Diffusion Transformer, DiT)} 模型的内在机制来提高文本渲染效果。\textbf{FreeText} 将问题分解为 \emph{where to write} 和 \emph{what to write}。对于 \emph{where to write},我们通过读取来自端到文本注意力的 token 级空间归因来局部化写入区域,使用类似沉积作用的 token 作为稳定的空间锚点,并采用拓扑感知细化以生成高置信度掩码。对于 \emph{what to write},我们引入谱调制字形注入 (Spectral-Modulated Glyph Injection, SGMI),通过频域带通调制注入噪声对齐的字形先验,以强化字形结构并抑制语义泄漏(渲染概念而非单词)。在 Qwen-Image、FLUX.1-dev 和 SD3 变体上进行大量实验,分别针对 longText-Benchmark、CVTG 和我们自建的 CLT-Bench 进行测试,结果显示该方法在保持语义对齐和美学质量的同时, consistently 提升文本可读性,同时推理开销适度。
引用
@article{arxiv.2601.00535,
title = {FreeText: Training-Free Text Rendering in Diffusion Transformers via Attention Localization and Spectral Glyph Injection},
author = {Ruiqiang Zhang and Hengyi Wang and Chang Liu and Guanjie Wang and Zehua Ma and Weiming Zhang},
journal= {arXiv preprint arXiv:2601.00535},
year = {2026}
}