跨语言视觉文本设计转换
计算机视觉与模式识别
2024-10-30 v2 人工智能
摘要
视觉文本设计在传递主题、情感和氛围方面在诸如电影海报和专辑封面等多模态格式中发挥着关键作用。将这些视觉和文本元素跨语言翻译将翻译的概念扩展到仅限于文本, 需要适应美学和风格特征。为此, 我们引入一种新的多模态风格翻译任务 (MuST-Bench), 一个旨在评估视觉文本生成模型在保持设计意图的同时跨不同书写系统进行翻译能力的基准。我们在 MuST-Bench 上的初始实验揭示, 现有的视觉文本生成模型在该任务上困难, 因为文本描述不足以传递视觉设计。作为回应, 我们引入 SIGIL, 一个消除风格描述需求的多模态风格翻译框架。SIGIL 通过三项创新措施提升图像生成模型: 用于多语言设置的字形潜在, 用于稳定风格引导的预训练 VAE, 以及用于优化可读字符生成的 OCR 模型和强化学习反馈。SIGIL 在保持视觉保真度的同时, 通过实现卓越的风格一致性和可读性, 超越了传统基于描述的方法。我们公开发布了 MuST-Bench 以供更广泛使用和探索 https://huggingface.co/datasets/yejinc/MuST-Bench。
引用
@article{arxiv.2410.18823,
title = {Towards Visual Text Design Transfer Across Languages},
author = {Yejin Choi and Jiwan Chung and Sumin Shim and Giyeong Oh and Youngjae Yu},
journal= {arXiv preprint arXiv:2410.18823},
year = {2024}
}