基于文本关键点与链接的任意形状场景文本检测与校正
计算机视觉与模式识别
2021-03-02 v1
摘要
由于文本行方向、长度、曲率等方面极其丰富的形状变化,任意形状场景文本的检测与识别仍是一项重大挑战。本文提出一种掩码引导的多任务网络,可可靠地检测并校正任意形状的场景文本。我们检测三类关键点,用以精确刻画文本实例的中心线及形状。此外,检测四类关键点链接:其中水平链接将每个文本实例的已检测关键点相关联,垂直链接为每个关键点预测沿上下文本边界的一对地标点。通过连接相关地标点(给出定位多边形框)可定位场景文本,并通过薄板样条变换多边形框可校正场景文本。在多个公开数据集上的大量实验表明,文本关键点的使用对文本方向、长度和曲率的变化具有鲁棒性,并且与最先进方法相比取得了更优的场景文本检测与校正性能。
引用
@article{arxiv.2103.00785,
title = {Detection and Rectification of Arbitrary Shaped Scene Texts by using Text Keypoints and Links},
author = {Chuhui Xue and Shijian Lu and Steven Hoi},
journal= {arXiv preprint arXiv:2103.00785},
year = {2021}
}