RewriteNet:基于文本内容与风格隐式分解的可靠场景文本编辑
计算机视觉与模式识别
2022-05-03 v2
摘要
场景文本编辑(Scene Text Editing, STE)旨在将场景图像中的文本转换为所需文本,同时保留原始风格。由于文本与风格之间存在复杂的干预,这是一项具有挑战性的任务。在本文中,我们提出了一种新颖的 STE 模型,称为 RewriteNet,该模型将文本图像分解为内容和风格特征,并在原始图像中重写文本。具体而言,RewriteNet 通过引入场景文本识别来隐式区分内容与风格。此外,独立于使用合成样本的精确监督,我们提出了一种用于无标签真实世界图像的自监督训练方案,该方案弥合了合成数据与真实数据之间的领域差距。我们的实验表明,RewriteNet 与其他对比方法相比取得了更好的生成性能。进一步的分析证明了 RewriteNet 的特征分解能力,并通过多样化的实验展示了其可靠性与鲁棒性。我们的实现已公开于 \url{https://github.com/clovaai/rewritenet}
引用
@article{arxiv.2107.11041,
title = {RewriteNet: Reliable Scene Text Editing with Implicit Decomposition of Text Contents and Styles},
author = {Junyeop Lee and Yoonsik Kim and Seonghyeon Kim and Moonbin Yim and Seung Shin and Gayoung Lee and Sungrae Park},
journal= {arXiv preprint arXiv:2107.11041},
year = {2022}
}
备注
CVPRW 2022 - AI for Content Creation Workshop