基于扩散模型在自然场景中对场景文本进行编辑
计算机视觉与模式识别
2024-05-09 v2
摘要
扩散模型因在图像编辑中取得令人印象深刻的文生图结果而受到关注。另一方面,人们可能注意到稳定扩散模型生成的图像存在细节退化的问题。这一缺陷影响了需要信息保留的图像编辑任务,例如场景文本编辑。作为期望结果,模型必须能够将对源图像上的文本替换为目标文本,同时保留颜色、字体大小和背景等细节。为利用扩散模型的潜力,本文提出一种基于扩散的场景文本操作网络,称为 DBEST。具体而言,我们设计了两种适配策略,即一次性风格适配和文本识别引导。在实验中,我们在多个场景文本数据集上彻底评估并将所提方法与最先进方法进行比较,然后针对每个粒度提供广泛的消融研究以分析性能提升。此外,我们通过具有竞争力的光学字符识别(OCR)准确率证明了所提方法在合成场景文本上的有效性。我们的方法在 COCO-text 和 ICDAR2013 数据集上分别实现了 94.15% 和 98.12% 的字符级评估准确率。
引用
@article{arxiv.2311.00734,
title = {On Manipulating Scene Text in the Wild with Diffusion Models},
author = {Joshua Santoso and Christian Simon and Williem},
journal= {arXiv preprint arXiv:2311.00734},
year = {2024}
}
备注
Accepted to WACV 2024