中文

基于文本局化的场景文本移除文本感知掩码图像建模

计算机视觉与模式识别 2024-09-23 v1

摘要

现有场景文本移除 (STR) 任务因像素级标注成本高昂而训练数据不足。为此,本文提出 Text-aware Masked Image Modeling 算法 (TMIM),以低成本文本检测标签(如文本边界框)预训练 STR 模型。不同于以往仅通过间接辅助任务增强隐式特征提取的做法,TMIM 首次以弱监督方式直接训练 STR 任务,显式且高效地探索 STR 知识。TMIM 中,首先构建背景建模流,通过恢复被遮盖非文本区域学习背景生成规则,同时在被遮盖文本区域生成伪 STR 标签。其次,提出文本擦除流,从伪标签中学习,使模型具备端到端的 STR 能力。凭借这两个协作流,我们的 STR 模型仅需公共文本检测数据集即可实现卓越性能,显著缓解了高成本 STR 标签的限制。实验表明,我们的方法优于其他预训练方法,在 SCUT-EnsText 上达到 37.35 PSNR 的最先进水平。代码将在 https://github.com/wzx99/TMIM 公开。

关键词

引用

@article{arxiv.2409.13431,
  title  = {Leveraging Text Localization for Scene Text Removal via Text-aware Masked Image Modeling},
  author = {Zixiao Wang and Hongtao Xie and YuXin Wang and Yadong Qu and Fengjun Guo and Pengwei Liu},
  journal= {arXiv preprint arXiv:2409.13431},
  year   = {2024}
}

备注

Accepted by ECCV 2024