中文

DCText:基于分割- Conquer 策略的视觉文本生成的调度注意力掩码

计算机视觉与模式识别 2025-12-09 v2

摘要

尽管最近的文本到图像模型在文本渲染方面取得了高保真度,但仍在长文本或多文本场景中因全局注意力被稀释而难以应对。我们提出了 DCText,这是一种无需训练的视觉文本生成方法,采用分割- Conquer(Divide-and-Conquer)策略,利用多模态扩散变换器(Multi-Modal Diffusion Transformers)可靠的短文本生成能力。我们的 method 首先通过提取和分割目标文本,将其分配给指定区域。为在各区域内准确渲染每个片段,同时保持整体图像连贯性,我们引入两种注意力掩码——Text-Focus 和 Context-Expansion——在去噪过程中依次应用。此外,局部噪声初始化进一步在不增加计算成本的情况下提高文本准确性和区域对齐。大量实验表明,DCText 在单句和多句基准测试上实现了最佳文本准确率,且不损害图像质量,同时提供最低的生成延迟。

关键词

引用

@article{arxiv.2512.01302,
  title  = {DCText: Scheduled Attention Masking for Visual Text Generation via Divide-and-Conquer Strategy},
  author = {Jaewoo Song and Jooyoung Choi and Kanghyun Baek and Sangyub Lee and Daemin Park and Sungroh Yoon},
  journal= {arXiv preprint arXiv:2512.01302},
  year   = {2025}
}

备注

Accepted to WACV 2026