中文

TextAtlas5M:用于密集文本图像生成的大规模数据集

计算机视觉与模式识别 2025-11-04 v2

摘要

文本条件图像生成近年来受到广泛关注,并且正在处理越来越长的和综合的文本提示。在日常生活中,密集和复杂的文本常见于广告、信息图表和标识等场景,其中文本和视觉元素的集成对于传递复杂信息至关重要。尽管已取得这些进展,但生成包含长文本的图像仍是一个持久的挑战,主要由于现有数据集往往侧重于较短和简单的文本。为填补这一差距,我们引入TextAtlas5M,一个专为评估文本条件图像生成中长文本渲染而设计的新型数据集。该数据集由500万个长文本生成和收集的图像组成,涵盖多种数据类型,使大规模生成模型在长文本图像生成方面进行全面评估。我们进一步策划了3000个人工改进的测试集TextAtlasEval,涵盖3个数据领域,建立了最广泛的文本条件生成基准之一。评估表明,TextAtlasEval基准对最先进的专有模型(如GPT4o配合DallE-3)也提出显著挑战,而开源模型则显示更大的性能差距。这些证据将TextAtlas5M定位为训练和评估下一代文本条件图像生成模型的宝贵数据集。

关键词

引用

@article{arxiv.2502.07870,
  title  = {TextAtlas5M: A Large-scale Dataset for Dense Text Image Generation},
  author = {Alex Jinpeng Wang and Dongxing Mao and Jiawei Zhang and Weiming Han and Zhuobai Dong and Linjie Li and Yiqi Lin and Zhengyuan Yang and Libo Qin and Fuwei Zhang and Lijuan Wang and Min Li},
  journal= {arXiv preprint arXiv:2502.07870},
  year   = {2025}
}

备注

27 pages, 15 figures. Dataset Website: https://textatlas5m.github.io