超越文字:通过多模态自回归模型实现长文本图像生成
计算机视觉与模式识别
2025-03-27 v1
摘要
近期自回归和扩散模型的进展导致在短场景文本单词图像生成中取得优异性能,但生成图像中的连贯长文本(如幻灯片或文档中的段落)仍是当前生成模型的主要挑战。我们首次聚焦于长文本图像生成,填补现有仅处理简短短语或单句子的文本到图像系统的关键空白。通过对主流自回归生成模型的全面分析,我们识别出图像 tokenizer 是文本生成质量的关键瓶颈。为此,我们引入一种针对长文本图像生成的 novel text-focused 二进制 tokenizer,优化以捕获详细场景文本特征。借助我们的 tokenizer,我们开发了 \ModelName,一种在生成高质量长文本图像方面具有前所未有保真度的多模态自回归模型。我们的模型在文本属性(如字体样式、大小、颜色和对齐方式)方面表现出稳健的可控性。广泛实验表明,\ModelName 在长文本准确、一致、灵活地生成方面显著优于 SD3.5 Large\cite{sd3} 和 GPT4o\cite{gpt4o},并与 DALL-E 3\cite{dalle3} 相比表现更佳。除技术成就外,\ModelName 开启了诸如交错文档和 PowerPoint 生成等创新应用的新机遇,确立了长文本图像生成的新前沿。
引用
@article{arxiv.2503.20198,
title = {Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models},
author = {Alex Jinpeng Wang and Linjie Li and Zhengyuan Yang and Lijuan Wang and Min Li},
journal= {arXiv preprint arXiv:2503.20198},
year = {2025}
}
备注
16 pages