中文

CharGen:面向高精度字符级视觉文本生成的多模态编码器模型

计算机视觉与模式识别 2024-12-24 v1

摘要

最近,扩散式视觉文本生成模型取得了显著进展。虽然这些方法在视觉文本渲染方面效果迅速提升,但仍面临字符和笔画不准等挑战。本文提出CharGen,一个高度精确的字符级视觉文本生成与编辑模型。具体而言,CharGen采用字符级多模态编码器,不仅提取字符级文本嵌入,还对字符图像进行逐字符编码。这使其能够更有效地捕获细粒度的跨模态特征。此外,我们引入了新的感知损失以增强字符形状监督,解决生成文本中笔画不准的问题。值得一提的是,CharGen可以集成到现有的扩散模型中,以实现高精度的视觉文本生成。在AnyText-benchmark和MARIO-Eval等公开基准测试中,CharGen显著提升了文本渲染精度,分别优于最新方法超过8%和6%。值得注意的是,CharGen在中文测试集上的准确率提升了5.5%。

关键词

引用

@article{arxiv.2412.17225,
  title  = {CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder},
  author = {Lichen Ma and Tiezhu Yue and Pei Fu and Yujie Zhong and Kai Zhou and Xiaoming Wei and Jie Hu},
  journal= {arXiv preprint arXiv:2412.17225},
  year   = {2024}
}