PAN++:面向自然场景中任意形状文本的高效准确端到端 spotting
计算机视觉与模式识别
2021-08-03 v4
摘要
场景文本检测与识别在过去几年中已得到充分探索。尽管取得了进展,高效且准确的任意形状文本端到端spotting仍具挑战性。本文中,我们提出一种端到端文本spotting框架,称为PAN++,其可高效检测并识别自然场景中任意形状的文本。PAN++基于核表示,该表示将文本行重新表述为被外围像素包围的文本核(中心区域)。通过系统性地与现有场景文本表示比较,我们表明我们的核表示不仅能描述任意形状文本,还能很好区分相邻文本。此外,作为一种基于像素的表示,核表示可由单一全卷积网络预测,这对实时应用非常友好。利用核表示的优势,我们设计了一系列组件如下:1) 由堆叠的特征金字塔增强模块(FPEM)组成的计算高效的特征增强网络;2) 与像素聚合(PA)协作的轻量检测头;3) 带有掩码RoI的基于注意力的高效识别头。得益于核表示与定制组件,我们的方法在保持有竞争力精度的同时实现了高推理速度。大量实验显示了我们方法的优越性。例如,所提PAN++在Total-Text数据集上以29.2 FPS取得64.9的端到端文本spotting F值,显著优于先前最佳方法。代码将发布于:https://git.io/PAN。
引用
@article{arxiv.2105.00405,
title = {PAN++: Towards Efficient and Accurate End-to-End Spotting of Arbitrarily-Shaped Text},
author = {Wenhai Wang and Enze Xie and Xiang Li and Xuebo Liu and Ding Liang and Zhibo Yang and Tong Lu and Chunhua Shen},
journal= {arXiv preprint arXiv:2105.00405},
year = {2021}
}
备注
Accepted to TPAMI 2021