FETNet:面向场景文本去除的特征擦除与迁移网络
计算机视觉与模式识别
2023-06-19 v1
摘要
场景文本去除(STR)任务旨在去除图像中的文本区域并平滑恢复背景,以保护隐私信息。多数现有 STR 方法采用基于编码器-解码器的 CNN,并在跳跃连接中直接复制特征。然而,编码特征同时包含文本纹理与结构信息;文本特征利用不足制约了文本去除区域的背景重建性能。为解决这些问题,本文提出一种新颖的特征擦除与迁移(FET)机制,为 STR 重构编码特征。FET 中设计了特征擦除模块(FEM)以擦除文本特征;一个注意力模块负责生成特征相似性引导;引入特征迁移模块(FTM)基于注意力引导在不同层间迁移相应特征。基于该机制,构建了单阶段、端到端可训练的网络 FETNet 用于场景文本去除。此外,为促进场景文本去除与分割任务的研究,我们引入带多类别标注的新数据集 Flickr-ST。在公开数据集与 Flickr-ST 上进行了充分的实验与消融研究。所提方法在多数指标上取得 SOTA 性能,场景文本去除结果质量显著更高。工作源代码见:\href{https://github.com/GuangtaoLyu/FETNet}{https://github.com/GuangtaoLyu/FETNet}。
引用
@article{arxiv.2306.09593,
title = {FETNet: Feature Erasing and Transferring Network for Scene Text Removal},
author = {Guangtao Lyu and Kun Liu and Anna Zhu and Seiichi Uchida and Brian Kenji Iwana},
journal= {arXiv preprint arXiv:2306.09593},
year = {2023}
}
备注
Accepted by Pattern Recognition 2023