中文

MSLKANet:一种用于场景文本去除的多尺度大核注意力网络

计算机视觉与模式识别 2022-11-15 v1

摘要

场景文本去除旨在去除自然图像中的文本,并用视觉上合理的背景信息填充相应区域。由于其在隐私保护、场景文本检索和文本编辑等方面的多种应用,该任务已引起越来越多的关注。随着深度学习的发展,以往方法已取得显著改进。然而,大多数现有方法似乎忽视了大感受野与全局信息。先驱方法仅将训练数据从裁剪图像改为完整图像便获得了显著改进。本文提出一种用于完整图像中场景文本去除的单阶段多尺度网络 MSLKANet。为获取大感受野与全局信息,我们提出多尺度大核注意力(MSLKA)以在各种粒度水平上获取文本区域与背景之间的长程依赖。此外,我们结合大核分解机制与空洞空间金字塔池化构建大核空间金字塔池化(LKSPP),其能在保持大感受野与低计算成本的同时感知空间中更多有效像素。大量实验结果表明,所提方法在合成与真实世界数据集上均达到最先进性能,且所提组件 MSLKA 与 LKSPP 有效。

关键词

引用

@article{arxiv.2211.06565,
  title  = {MSLKANet: A Multi-Scale Large Kernel Attention Network for Scene Text Removal},
  author = {Guangtao Lyu},
  journal= {arXiv preprint arXiv:2211.06565},
  year   = {2022}
}