中文

基于解耦而协同的检测与识别的单次自可靠场景文本 spotting 器

计算机视觉与模式识别 2023-02-08 v4

摘要

典型的文本 spotter 遵循两阶段 spotting 范式,即先检测文本实例的边界,再在检测区域内进行文本识别。尽管该 spotting 范式取得了显著进展,一个重要局限在于文本识别的性能严重依赖于文本检测的精度,导致从检测到识别的潜在误差传播。本工作中,我们提出单次自可靠场景文本 Spotter v2(SRSTS v2),通过从检测中解耦识别同时协同优化两项任务来规避此局限。具体而言,我们的 SRSTS v2 在每个潜在文本实例周围采样代表性特征点,并在这些采样点引导下并行执行文本检测与识别。因此,文本识别不再依赖于检测,从而缓解了从检测到识别的误差传播。此外,采样模块在来自检测与识别的共同监督下学习,这使得两项任务间的协同优化与相互增强成为可能。得益于这种采样驱动并发 spotting 框架,即便精确文本边界难以检测,我们的方法仍能正确识别文本实例。在四个基准上的大量实验表明,我们的方法与最先进的 spotter 相比具有优势。

关键词

引用

@article{arxiv.2207.07253,
  title  = {Single Shot Self-Reliant Scene Text Spotter by Decoupled yet Collaborative Detection and Recognition},
  author = {Jingjing Wu and Pengyuan Lyu and Guangming Lu and Chengquan Zhang and Wenjie Pei},
  journal= {arXiv preprint arXiv:2207.07253},
  year   = {2023}
}