学习用于场景文本检测的鲁棒特征表示
计算机视觉与模式识别
2020-05-27 v1
摘要
基于深度神经网络的场景文本检测在过去几年中取得了实质性进展。然而,以往最先进的方法在处理具有挑战性的公开基准时仍可能不足,因为算法性能取决于鲁棒特征提取与网络架构中的组件。为解决此问题,我们将提出一种网络架构,其派生自通过以适当近似后验优化下界来最大化条件对数似然的损失,该方法已在若干生成模型中展现出令人印象深刻的性能。此外,通过将潜变量层扩展至多层,该网络能够在不使用任务特定正则化或数据增强的情况下,在尺度上学习鲁棒特征。我们提供详细分析并展示在三个公开基准数据集上的结果,以确认所提算法的效率与可靠性。实验中,所提算法在召回率与精确率方面均显著优于最先进方法。具体而言,其在 ICDAR 2011 与 ICDAR 2013 上分别取得 95.12 与 96.78 的 H-mean。
引用
@article{arxiv.2005.12466,
title = {Learning Robust Feature Representations for Scene Text Detection},
author = {Sihwan Kim and Taejang Park},
journal= {arXiv preprint arXiv:2005.12466},
year = {2020}
}