中文

TextPixs:基于字符感知注意力和 OCR 引导的字形条件扩散

计算机视觉与模式识别 2025-07-09 v1 人工智能 机器学习

摘要

现代 text-to-image 扩散模型的崛起开启了数字内容生产的新时代,证明了其基于自然语言描述语义能够生成 photorealistic 且风格多样的图像。然而,这些模型始终存在的一致缺点是无法在生成图像中生成可读、有意义且拼写正确的文本,这显著限制了 advertising、学习和 creative design 等实际应用的使用。本文引入一种新框架,即 Glyph-Conditioned Diffusion with Character-Aware Attention (GCDA),通过三个 well-designed 模块扩展典型的 diffusion 主干网络。首先,模型拥有 dual-stream text encoder,对语义上下文信息和 explicit glyph 表示进行编码,生成富有性质的 character-aware 文本表示。其次,提出一种 character-aware 注意力机制,引入新的 attention segregation loss,以限制每个 character 的注意力分布独立,从而避免 distortion 痕迹。最后,GCDA 具备 OCR-in-the-loop fine-tuning 阶段,其中通过 full text perceptual loss 直接优化模型以确保文本可读且拼写准确。大规模实验在 benchmark 数据集(如 MARIO-10M 和 T2I-CompBench)中表明,GCDA 在所有 metric 上均达到 state-of-the-art,character-based metric 在 text rendering 方面表现更佳(Character Error Rate: 0.08 vs 0.21;Word Error Rate: 0.15 vs 0.25),人类感知方面表现更好,在 high-fidelity (FID: 14.3) 方面保持 comparable image synthesis quality。

关键词

引用

@article{arxiv.2507.06033,
  title  = {TextPixs: Glyph-Conditioned Diffusion with Character-Aware Attention and OCR-Guided Supervision},
  author = {Syeda Anshrah Gillani and Mirza Samad Ahmed Baig and Osama Ahmed Khan and Shahid Munir Shah and Umema Mujeeb and Maheen Ali},
  journal= {arXiv preprint arXiv:2507.06033},
  year   = {2025}
}

备注

30 pages