中文

学习增强:面向文本识别的数据增强与网络联合优化

计算机视觉与模式识别 2020-03-17 v1

摘要

手写文本与场景文本存在多种形状与失真模式。因此,训练一个鲁棒的识别模型需要大量数据以尽可能覆盖多样性。与数据收集与标注相比,数据增强是一种低成本方式。本文提出一种新的文本图像增强方法。与旋转、缩放和透视变换等传统增强方法不同,我们所提增强方法旨在学习恰当且高效的数据增强,对训练鲁棒识别器更具针对性和有效性。通过使用一组自定义基准点,所提增强方法灵活可控。此外,我们通过联合学习弥合了数据增强与网络优化这两个孤立过程之间的鸿沟。一个智能体网络从识别网络的输出中学习,并控制基准点以为识别网络生成更合适的训练样本。在包括规则场景文本、不规则场景文本和手写文本在内的多种基准上的大量实验表明,所提增强与联合学习方法显著提升了识别网络的性能。一个用于几何增强的通用工具包已公开。

关键词

引用

@article{arxiv.2003.06606,
  title  = {Learn to Augment: Joint Data Augmentation and Network Optimization for Text Recognition},
  author = {Canjie Luo and Yuanzhi Zhu and Lianwen Jin and Yongpan Wang},
  journal= {arXiv preprint arXiv:2003.06606},
  year   = {2020}
}

备注

Accepted to Proc. IEEE Conf. Comp. Vis. Pattern Recogn. (CVPR) 2020