UNITS:面向场景文本检测的无监督中间训练阶段
计算机视觉与模式识别
2022-05-11 v1
摘要
近期的场景文本检测方法几乎都基于深度学习和数据驱动。由于标注成本高昂,合成数据常被用于预训练。然而,合成数据与真实世界数据之间存在明显的域差异。若在微调阶段直接采用由合成数据初始化的模型,可能导致次优性能。本文提出一种用于场景文本检测的新训练范式,引入一个无监督中间训练阶段(UNITS,即 \textbf{UN}supervised \textbf{I}ntermediate \textbf{T}raining \textbf{S}tage),其构建通往真实世界数据的缓冲路径,可缓解预训练阶段与微调阶段之间的鸿沟。进一步探索了三种以无监督方式从真实世界数据感知信息的训练策略。借助UNITS,场景文本检测器在推理时不引入任何参数与计算即可得到提升。大量实验结果表明在三个公开数据集上取得一致的性能提升。
引用
@article{arxiv.2205.04683,
title = {UNITS: Unsupervised Intermediate Training Stage for Scene Text Detection},
author = {Youhui Guo and Yu Zhou and Xugong Qin and Enze Xie and Weiping Wang},
journal= {arXiv preprint arXiv:2205.04683},
year = {2022}
}
备注
Accepted by ICME 2022