A3S:面向场景文本检测的语义表示对抗学习
计算机视觉与模式识别
2023-02-22 v1
摘要
场景文本检测是一项在自然场景图像上预测文本区域并同时识别其文本字符的任务。由于广泛应用,近年来备受关注。现有研究主要集中于改进文本区域检测,而非文本识别。因此,尽管检测精度有所提升,端到端精度仍显不足。自然场景图像中的文本往往不是随机字符串,而是有意义的字符串,即单词。为此,我们提出面向场景文本检测的语义表示对抗学习(A3S),以提升包括文本识别在内的端到端精度。A3S 在检测到的文本区域中同时预测语义特征,而非仅基于现有视觉特征进行文本识别。在公开数据集上的实验结果表明,所提方法取得了优于其他方法的精度。
引用
@article{arxiv.2302.10641,
title = {A3S: Adversarial learning of semantic representations for Scene-Text Spotting},
author = {Masato Fujitake},
journal= {arXiv preprint arXiv:2302.10641},
year = {2023}
}
备注
Accepted to ICASSP 2023