中文

TextInVision:基于文本与提示复杂度的视觉文本生成基准

计算机视觉与模式识别 2025-03-19 v1 计算与语言

摘要

将嵌入文本的图像生成对于自动制作视觉和多模态文档(如教育材料和广告)至关重要。然而,现有的基于扩散的文本到图像模型往往难以准确地将文本嵌入图像中,面临拼写准确性、上下文相关性和视觉连贯性等挑战。评估此类模型将文本嵌入生成图像中的能力面临基准全面性不足的困难。本文引入TextInVision,一个大型且由文本与提示复杂度驱动的基准,旨在评估扩散模型有效地将视觉文本整合到图像中的能力。我们构建了一组多样化的提示和文本,考虑各种属性和文本特征。此外,我们准备了图像数据集以测试不同的字符表示下的变分自编码器(VAE)模型,突显了VAE架构在扩散框架中进行文本生成也可能面临的挑战。通过对多个模型进行广泛分析,我们识别出常见错误,突出显示拼写不准确和上下文不匹配等问题。通过指出不同提示和文本中的失败点,本研究为未来在AI生成的多模态内容方面的进步奠定了基础。

关键词

引用

@article{arxiv.2503.13730,
  title  = {TextInVision: Text and Prompt Complexity Driven Visual Text Generation Benchmark},
  author = {Forouzan Fallah and Maitreya Patel and Agneet Chatterjee and Vlad I. Morariu and Chitta Baral and Yezhou Yang},
  journal= {arXiv preprint arXiv:2503.13730},
  year   = {2025}
}