基于阅读顺序估计与动态采样的逆样对抗式场景文本识别
计算机视觉与模式识别
2024-01-09 v1
摘要
场景文本识别是一项具有挑战性的任务,尤其对于具有复杂布局(如镜像、对称或反折)的逆样场景文本而言。本文提出了一种统一的端到端可训练的逆样对抗式文本识别框架,称为 IATS,该框架能够有效识别逆样场景文本,同时不影响对常规文本的识别。具体来说,我们提出了一个创新的阅读顺序估计模块(REM),该模块从初始边界模块(IBM)生成的初始文本边界中提取阅读顺序信息。为了优化和训练 REM,我们提出了一种联合阅读顺序估计损失,该损失由分类损失、正交性损失和分布损失组成。借助 IBM,我们可以将初始文本边界划分为两个对称控制点,并使用轻量级边界细化模块(BRM)迭代地细化新的文本边界,以适应各种形状和尺度。为了缓解文本检测与识别之间的不兼容性,我们提出了一个带有薄板样条的动态采样模块(DSM),该模块可以在检测到的文本区域内动态地采样适合识别的特征。在无需额外监督的情况下,DSM 可以通过识别模块返回的梯度主动学习采样适合文本识别的特征。在具有挑战性的场景文本和逆样场景文本数据集上进行的大量实验表明,我们的方法在不规则和逆样文本识别方面均取得了优越的性能。
引用
@article{arxiv.2401.03637,
title = {Inverse-like Antagonistic Scene Text Spotting via Reading-Order Estimation and Dynamic Sampling},
author = {Shi-Xue Zhang and Chun Yang and Xiaobin Zhu and Hongyang Zhou and Hongfa Wang and Xu-Cheng Yin},
journal= {arXiv preprint arXiv:2401.03637},
year = {2024}
}
备注
14 pages, 16 figures, Accepted by TIP-2024