中文

研究文本隔离与注意力机制用于复杂视觉文本生成

计算机视觉与模式识别 2026-03-02 v7

摘要

在本文中,我们提出了 TextCrafter,一个受认知科学中选择性视觉注意力启发而设计的复杂视觉文本生成(CVTG)框架,并引入了"文本隔离与注意力"机制。为了实现"选择作用于离散对象"的选择性注意力原理,我们提出了一种新颖的瓶颈感知约束强化学习方法用于多文本隔离,该方法在不引入额外参数的情况下显著提升了强 Qwen-Image 预训练模型的文本渲染性能。为了与人类视觉中的选择性集中原理保持一致,我们引入了一个文本导向的注意力模块,其中包含一种新颖的引号引导注意力门控,进一步提升了每个文本实例的生成质量。我们基于强化学习的文本隔离方法取得了最先进的结果,而引入文本导向的注意力在已经很强的基线之上带来了额外的提升。更重要的是,我们引入了 CVTG-2K,一个包含 2,000 个复杂视觉文本提示的基准。这些提示在位置、数量、长度和属性上各不相同,并涵盖了多种真实世界场景。在 CVTG-2K、CVTG-Hard、LongText-Bench 和 Geneval 数据集上的广泛评估证实了 TextCrafter 的有效性。尽管使用的资源(例如 4 块 GPU)显著少于工业级模型(如 Qwen-Image、GPT Image 和 Seedream),TextCrafter 在缓解文本误生成、遗漏和幻觉方面取得了更优的性能。

关键词

引用

@article{arxiv.2503.23461,
  title  = {Investigating Text Insulation and Attention Mechanisms for Complex Visual Text Generation},
  author = {Ying Tai and Nikai Du and Rui Xie and Zhennan Chen and Qian Wang and Zhengkai Jiang and Kai Zhang and Jian Yang},
  journal= {arXiv preprint arXiv:2503.23461},
  year   = {2026}
}