Glyph-ByT5:用于准确视觉文本渲染的定制文本编码器
计算机视觉与模式识别
2024-07-15 v2
摘要
视觉文本渲染是当代文本到图像生成模型面临的根本挑战,核心问题在于文本编码器的不足。为实现准确的文本渲染,我们确定文本编码器需要具备两个关键要求:字符感知能力和与字形的对齐。我们的解决方案是通过精心策划的配对字形-文本数据集,对具有字符感知能力的 ByT5 编码器进行微调,以构建一系列定制文本编码器 Glyph-ByT5。我们提出一种有效的方法,将 Glyph-ByT5 与 SDXL 集成,创建用于设计图像生成的 Glyph-SDXL 模型。这显著提高了文本渲染的准确性,将其从不足 提升到接近 (基于我们的设计图像基准)。值得注意的是,Glyph-SDXL 能够进行文本段落渲染,实现对数十至数百个字符的高拼写准确率,并自动实现多行布局。最后,通过使用小量高质量、照片写实风格的图像进行微调,包含视觉文本的场景文本渲染能力在开放领域的真实图像中得到显著提升。这些引人注目的成果旨在鼓励进一步探索为 diverse and challenging 任务设计定制文本编码器。
引用
@article{arxiv.2403.09622,
title = {Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text Rendering},
author = {Zeyu Liu and Weicong Liang and Zhanhao Liang and Chong Luo and Ji Li and Gao Huang and Yuhui Yuan},
journal= {arXiv preprint arXiv:2403.09622},
year = {2024}
}
备注
ECCV 2024, 19 pages, 19 figures