STEFANN:使用字体自适应神经网络的场景文本编辑器
计算机视觉与模式识别
2025-02-19 v4 多媒体
摘要
捕获场景中的文本信息在场景理解和决策制定中起着重要作用。尽管已有方法能够成功检测和理解场景中存在的复杂文本区域,但据我们所知,目前尚无旨在修改图像中文本信息的重要前期工作。直接在图像上编辑文本的能力具有诸多优势,包括纠错、文本修复和图像重用。在本文中,我们提出一种在字符级别修改图像中文本的方法。我们分两个阶段处理该问题。首先,从正在被修改的观测字符(源)生成未观测字符(目标)。我们提出两种不同的神经网络架构—— FANnet 用于实现与源字体的结构一致性,以及 Colornet 用于保持源颜色。接着,我们将源字符替换为生成的字符,同时保持与相邻字符在几何和视觉上的一致性。我们的方法作为修改图像中文本的统一平台。我们在 COCO-Text 和 ICDAR 数据集上定性和定量地展示了我们方法的有效性。
引用
@article{arxiv.1903.01192,
title = {STEFANN: Scene Text Editor using Font Adaptive Neural Network},
author = {Prasun Roy and Saumik Bhattacharya and Subhankar Ghosh and Umapada Pal},
journal= {arXiv preprint arXiv:1903.01192},
year = {2025}
}
备注
Accepted in The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2020