CharGen:面向高精度字符级视觉文本生成的多模态编码器模型
计算机视觉与模式识别
2024-12-24 v1
摘要
最近,扩散式视觉文本生成模型取得了显著进展。虽然这些方法在视觉文本渲染方面效果迅速提升,但仍面临字符和笔画不准等挑战。本文提出CharGen,一个高度精确的字符级视觉文本生成与编辑模型。具体而言,CharGen采用字符级多模态编码器,不仅提取字符级文本嵌入,还对字符图像进行逐字符编码。这使其能够更有效地捕获细粒度的跨模态特征。此外,我们引入了新的感知损失以增强字符形状监督,解决生成文本中笔画不准的问题。值得一提的是,CharGen可以集成到现有的扩散模型中,以实现高精度的视觉文本生成。在AnyText-benchmark和MARIO-Eval等公开基准测试中,CharGen显著提升了文本渲染精度,分别优于最新方法超过8%和6%。值得注意的是,CharGen在中文测试集上的准确率提升了5.5%。
引用
@article{arxiv.2412.17225,
title = {CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder},
author = {Lichen Ma and Tiezhu Yue and Pei Fu and Yujie Zhong and Kai Zhou and Xiaoming Wei and Jie Hu},
journal= {arXiv preprint arXiv:2412.17225},
year = {2024}
}