TLGAN:基于生成对抗网络的文档文本定位
计算机视觉与模式识别
2020-10-23 v1 机器学习
摘要
从数字图像中进行文本定位是光学字符识别任务的第一步。基于传统图像处理的文本定位对特定样例表现充分。然而,通用文本定位仅由近期基于深度学习的模态实现。这里我们提出文档文本定位生成对抗网络(TLGAN),其为用于从数字图像执行文本定位的深度神经网络。TLGAN 是一种通用且易训练的文本定位模型,仅需少量数据。仅使用来自扫描收据 OCR 与信息抽取鲁棒阅读挑战(SROIE)的十张标注收据图像进行训练,TLGAN 在 SROIE 测试数据上取得了 99.83% 的精确率与 99.64% 的召回率。我们的 TLGAN 是一种实用的文本定位方案,仅需极少的数据标注与模型训练工作,并产出最先进的性能。
引用
@article{arxiv.2010.11547,
title = {TLGAN: document Text Localization using Generative Adversarial Nets},
author = {Dongyoung Kim and Myungsung Kwak and Eunji Won and Sejung Shin and Jeongyeon Nam},
journal= {arXiv preprint arXiv:2010.11547},
year = {2020}
}
备注
17 pages, three figures, 4 tables, methods for IEEE ICDAR RRC SROIE task1 leader board