EnsNet:将自然场景中的文本隐没
计算机视觉与模式识别
2018-12-04 v1
摘要
本文提出一种从自然图像中去除文本的新方法。其挑战在于首先精确地在笔画级别定位文本,然后将其替换为视觉上合理的背景。与以往需要图像块来擦除场景文本的方法不同,我们的方法即隐没网络(EnsNet)可在单张图像上端到端运行,无需任何先验知识。整体结构是一个端到端可训练的 FCN-ResNet-18 网络与条件生成对抗网络(cGAN)的组合。前者的特征首先通过一种新颖的横向连接结构得到增强,随后由四个精心设计的损失函数细化:多尺度回归损失与内容损失,用于捕捉不同层级特征的全局差异;纹理损失与全变分损失,主要用于填充文本区域并保持背景的真实感。后者是一种新颖的局部敏感 GAN,可专注评估文本擦除区域的局部一致性。在合成图像与 ICDAR 2013 数据集上的定性与定量敏感性实验表明,EnsNet 的每个组件对于取得良好性能都必不可少。此外,我们的 EnsNet 在所有指标上均显著优于以往的 SOTA 方法。另外,在 SMBNet 数据集上进行的定性实验进一步表明,所提方法在通用目标(如行人)去除任务上同样表现良好。EnsNet 极快,在 i5-8600 CPU 设备上可达 333 fps。
引用
@article{arxiv.1812.00723,
title = {EnsNet: Ensconce Text in the Wild},
author = {Shuaitao Zhang and Yuliang Liu and Lianwen Jin and Yaoxiong Huang and Songxuan Lai},
journal= {arXiv preprint arXiv:1812.00723},
year = {2018}
}
备注
8 pages, 8 figures, 2 tables, accepted to appear in AAAI 2019