通过输入粒度控制和字形感知训练赋能视觉文本生成的骨干模型
计算机视觉与模式识别
2024-10-08 v1 人工智能
摘要
基于扩散的文本到图像模型在多样性和美学方面取得了令人瞩目的成就,但在生成带有清晰视觉文本的图像方面仍存在困难。现有的骨干模型存在拼写错误、无法生成文本以及缺乏对中文文本支持等局限性,但它们的发展显示出巨大的潜力。在本文中,我们提出了一系列方法,旨在赋能骨干模型生成英文和中文的视觉文本。我们首先进行了一项初步研究,揭示出字节对编码(BPE)分词以及交叉注意力模块学习不足限制了骨干模型的性能。基于这些观察,我们进行了以下改进:(1)我们设计了一种混合粒度输入策略,以提供更合适的文本表示;(2)我们提出用三种字形感知训练损失来增强传统训练目标,这加强了对交叉注意力模块的学习,并鼓励模型关注视觉文本。通过实验,我们证明了我们的方法能够有效赋能骨干模型生成语义相关、美观且准确的视觉文本图像,同时保持其基本的图像生成质量。
引用
@article{arxiv.2410.04439,
title = {Empowering Backbone Models for Visual Text Generation with Input Granularity Control and Glyph-Aware Training},
author = {Wenbo Li and Guohao Li and Zhibin Lan and Xue Xu and Wanru Zhuang and Jiachen Liu and Xinyan Xiao and Jinsong Su},
journal= {arXiv preprint arXiv:2410.04439},
year = {2024}
}