中文

TextGround4M:用于布局感知文本渲染的提示对齐数据集

计算机视觉与模式识别 2026-04-28 v1

摘要

尽管近期在文本到图像生成方面取得了进展,但模型仍在准确渲染提示指定文本时难以实现正确的空间布局,尤其是在多区间、结构化设置下更为如此。这种挑战不仅源于缺乏将提示与图像中预期的确切文本和布局对齐的数据集,还源于缺乏有效衡量布局质量的度量标准。为此,我们引入 TextGround4M,一个规模庞大的数据集,包含超过 400 万组提示-图像对,每组都标注了以提示为基础的区间级文本及其对应的边界框。这一标注为布局感知、提示对齐文本渲染提供了细粒度的监督。基于此,我们提出了一种轻量级训练策略,用于自回归 T2I 模型,在训练期间附加布局感知区间标记,却不改变模型架构或推理行为。我们进一步构建了一个具有分层布局复杂度的基准,用于在零-shot 设置下评估开源和专有模型。此外,我们引入两个布局感知度量标准,以解决文本渲染中长期缺失的空间评估问题。我们的结果表明,在文本保真度、空间精确度和提示一致性方面,训练 TextGround4M 的模型均优于强大的基准,凸显了细粒度布局监督对扎根 T2I 生成的重要性。

关键词

引用

@article{arxiv.2604.24459,
  title  = {TextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering},
  author = {Dongxing Mao and Yilin Wang and Linjie Li and Zhengyuan Yang and Alex Jinpeng Wang},
  journal= {arXiv preprint arXiv:2604.24459},
  year   = {2026}
}

备注

aaai poster; Project page: https://dongxingmao.github.io/TextGround4M.github.io/