半监督文本识别的顺序视觉与语义一致性
计算机视觉与模式识别
2024-02-27 v1
摘要
场景文本识别 (STR) 是一项具有挑战性的任务,需要大规模标注数据进行训练。然而,收集和标注真实文本图像既昂贵又耗时,限制了真实数据的可用性。因此,大多数现有的 STR 方法诉诸于合成数据,这可能会引入领域差异并降低 STR 模型的性能。为了缓解这一问题,最近的半监督 STR 方法通过在相同图像的弱增强和强增强视图之间强制字符级一致性正则化来利用未标注的真实数据。然而,这些方法忽略了对于序列识别任务至关重要的词级一致性。本文提出了一种新的 STR 半监督学习方法,该方法结合了来自视觉和语义两个方面的词级一致性正则化。具体而言,我们设计了一个最短路径对齐模块,以对齐不同视图的顺序视觉特征并最小化它们的距离。此外,我们采用强化学习框架来优化嵌入空间中预测字符串的语义相似性。我们在几个标准和具有挑战性的 STR 基准上进行了广泛的实验,证明了所提方法优于现有的半监督 STR 方法。
引用
@article{arxiv.2402.15806,
title = {Sequential Visual and Semantic Consistency for Semi-supervised Text Recognition},
author = {Mingkun Yang and Biao Yang and Minghui Liao and Yingying Zhu and Xiang Bai},
journal= {arXiv preprint arXiv:2402.15806},
year = {2024}
}
备注
Accepted by Pattern Recognition Letters