学习预测更精确的文本实例以用于场景文本检测
计算机视觉与模式识别
2020-04-17 v2
摘要
目前,基于深度神经网络的多方向文本检测方法已在各种基准上取得令人满意的性能。然而,任意形状文本检测仍存在若干困难,尤其是任意形状文本实例的简单且恰当的表示。本文提出一种基于像素的文本检测器,以简单方式促进任意形状文本实例的表示与预测。首先,为缓解目标顶点排序的影响并实现任意形状文本实例的直接回归,提出了与起点无关的坐标回归损失。此外,为预测更精确的文本实例,提出了文本实例精度损失作为辅助任务,在 IoU 的指导下细化预测坐标。为评估检测器的有效性,已在包含任意形状文本实例与多方向文本实例的公开基准上进行了大量实验。我们在 Total-Text 基准上获得了 84.8% 的 F-measure。结果表明,我们的方法可达到最先进的性能。
引用
@article{arxiv.1911.07423,
title = {Learning to Predict More Accurate Text Instances for Scene Text Detection},
author = {XiaoQian Li and Jie Liu and ShuWu Zhang and GuiXuan Zhang},
journal= {arXiv preprint arXiv:1911.07423},
year = {2020}
}