深入探索多域噪声场景中文本 spotting 的深度
计算机视觉与模式识别
2024-02-20 v3
摘要
在真实世界噪声环境中使用时,对任意自主场景文本 spotting 系统而言,泛化到多个域的能力至关重要。然而,现有最优方法在自然场景数据集上采用预训练与微调策略,未利用跨其他复杂域的特征交互。本文中,我们探索并研究域无关场景文本 spotting 问题,即在多域源数据上训练模型,使其可直接泛化至目标域,而非专用于特定域或场景。为此,我们向社区提供一个用于噪声水下场景的文本 spotting 验证基准 Under-Water Text (UWT),以建立重要案例研究。此外,我们还设计了一种高效的基于超分辨率的端到端 transformer 基线 DA-TextSpotter,在规则与任意形状场景文本 spotting 基准上,无论准确率还是模型效率,均取得优于或与现有文本 spotting 架构相当的性能。数据集、代码与预训练模型将在录用后发布。
引用
@article{arxiv.2310.00558,
title = {Diving into the Depths of Spotting Text in Multi-Domain Noisy Scenes},
author = {Alloy Das and Sanket Biswas and Umapada Pal and Josep Lladós},
journal= {arXiv preprint arXiv:2310.00558},
year = {2024}
}
备注
Accepted to ICRA 2024