SemiETS:融合空间与内容一致性的半监督端到端文本定位
计算机视觉与模式识别
2025-04-15 v1
摘要
以往的大多数场景文本定位方法依赖高质量人工标注以获得优异性能。为降低昂贵成本,我们研究半监督文本定位(SSTS),以利用未标注图像中的有用信息。然而,将现有通用场景的半监督方法直接应用于SSTS将面临新挑战:1) 检测与识别任务之间的伪标签不一致,以及2) 教师/学生模型间不一致导致的次优监督。因此,我们提出一个新的半监督端到端文本定位框架SemiETS,利用文本检测与识别的互补性。具体而言,它逐步为每个任务生成可靠的分层伪标签,从而减少噪声标签。同时,它从双向流中提取位置和转录中的重要信息以增强一致性。在三个数据集上的大量实验表明,SemiETS在任意形状文本上的有效性。例如,在Total-Text数据集上,在0.5%、1%和2%标注数据设置下,它在端到端定位上分别以较大优势超越先前最先进的SSL方法(H-mean提升+8.7%、+5.6%和+2.6%)。更重要的是,它甚至比使用大量标注数据训练的强监督文本定位器提升了2.0%。令人信服的域适应能力显示了实际潜力。此外,我们的方法在不同文本定位器上均表现出一致的改进。
引用
@article{arxiv.2504.09966,
title = {SemiETS: Integrating Spatial and Content Consistencies for Semi-Supervised End-to-end Text Spotting},
author = {Dongliang Luo and Hanshen Zhu and Ziyang Zhang and Dingkang Liang and Xudong Xie and Yuliang Liu and Xiang Bai},
journal= {arXiv preprint arXiv:2504.09966},
year = {2025}
}
备注
Accepted by CVPR2025. Code will be available at \url{https://github.com/DrLuo/SemiETS}