中文

利用合成标题改进图像中的文本生成

计算机视觉与模式识别 2024-10-24 v2

摘要

最近出现的潜在扩散模型,如SDXL和SD 1.5,在生成高度详细和逼真的图像方面显示出显著能力。尽管它们具有生成图像的卓越能力,但在图像中生成准确的文本仍然是一项具有挑战性的任务。在本文中,我们检验了微调方法在生成图像内可读文本方面的有效性。我们提出了一种低成本方法,利用SDXL而无需在大型数据集上进行耗时的训练。所提出的策略采用了一种微调技术,考察了数据精炼级别和合成标题的影响。此外,我们的结果展示了我们的小规模微调方法如何在不同场景下提高文本生成的准确性,而无需额外的多模态编码器。我们的实验表明,通过向原始数据集中添加随机字母,我们的模型在生成形态良好的视觉文本方面的性能得到了提升。

关键词

引用

@article{arxiv.2406.00505,
  title  = {Improving Text Generation on Images with Synthetic Captions},
  author = {Jun Young Koh and Sang Hyun Park and Joy Song},
  journal= {arXiv preprint arXiv:2406.00505},
  year   = {2024}
}

备注

2024 16th IIAI International Congress on Advanced Applied Informatics (IIAI-AAI)