中文

场景文本放大器

计算机视觉与模式识别 2019-07-08 v2 机器学习 机器学习

摘要

场景文本放大器旨在不进行识别的情况下放大自然场景图像中的文本。它可以帮助患有近视或阅读障碍的特殊群体更好地理解场景。在本文中,我们通过四个基于 CNN 的交互网络设计了场景文本放大器:字符擦除、字符提取、字符放大和图像合成。这些网络的架构基于沙漏编码器-解码器进行扩展。它输入原始场景文本图像并输出文本放大后的图像,同时保持背景不变。在中间过程中,我们可以获得文本擦除和文本提取的侧输出结果。这四个子网络首先独立训练,然后以端到端模式进行微调。每个阶段的训练样本通过一个流程处理,以 ICDAR2013 和 Flickr 数据集中的原始图像和文本标注作为输入,并输出相应的文本擦除图像、放大文本标注和文本放大场景图像。为了评估文本放大器的性能,使用结构相似性来度量每个字符区域内的区域变化。实验结果表明,我们的方法能够有效地放大场景文本而不影响背景。

关键词

引用

@article{arxiv.1907.00693,
  title  = {Scene Text Magnifier},
  author = {Toshiki Nakamura and Anna Zhu and Seiichi Uchida},
  journal= {arXiv preprint arXiv:1907.00693},
  year   = {2019}
}

备注

to appear at the International Conference on Document Analysis and Recognition (ICDAR) 2019