中文

Glyph-ByT5-v2:面向准确多语言视觉文本渲染的强劲审美基线

计算机视觉与模式识别 2024-07-15 v2

摘要

最近,Glyph-ByT5 在图形设计图像中的视觉文本渲染性能取得了高度准确的结果。然而,它仍仅关注英文,在视觉美感方面表现相对较差。在本工作中,我们针对这两个根本性局限性提出了 Glyph-ByT5-v2 和 Glyph-SDXL-v2,不仅支持10种不同语言的准确视觉文本渲染,还实现了更好的审美质量。为实现此目标,我们作出了以下贡献:(i) 创建由超过 100 万个字形-文本对和 1000 万个图形设计图像-文本对组成的高质量多语言字形-文本和图形设计数据集,覆盖其他9种语言;(ii) 构建由1000个提示构成的多语言视觉段落基准,每个语言100个,用于评估多语言视觉拼写准确性;(iii) 利用最新的感知偏好学习方法来提高视觉审美质量。通过这些技术的结合,我们提供了一个强大的定制多语言文本编码器 Glyph-ByT5-v2,以及一个在审美图形生成模型 Glyph-SDXL-v2,支持10种语言的准确拼写。我们认为我们的工作是一项重大进展,因为最新的 DALL-E3 和 Ideogram 1.0 仍在处理多语言视觉文本渲染任务方面存在挑战。

关键词

引用

@article{arxiv.2406.10208,
  title  = {Glyph-ByT5-v2: A Strong Aesthetic Baseline for Accurate Multilingual Visual Text Rendering},
  author = {Zeyu Liu and Weicong Liang and Yiming Zhao and Bohan Chen and Lin Liang and Lijuan Wang and Ji Li and Yuhui Yuan},
  journal= {arXiv preprint arXiv:2406.10208},
  year   = {2024}
}

备注

Project page: https://glyph-byt5-v2.github.io/