中文

深入探索多域噪声场景中文本 spotting 的深度

计算机视觉与模式识别 2024-02-20 v3

摘要

在真实世界噪声环境中使用时,对任意自主场景文本 spotting 系统而言,泛化到多个域的能力至关重要。然而,现有最优方法在自然场景数据集上采用预训练与微调策略,未利用跨其他复杂域的特征交互。本文中,我们探索并研究域无关场景文本 spotting 问题,即在多域源数据上训练模型,使其可直接泛化至目标域,而非专用于特定域或场景。为此,我们向社区提供一个用于噪声水下场景的文本 spotting 验证基准 Under-Water Text (UWT),以建立重要案例研究。此外,我们还设计了一种高效的基于超分辨率的端到端 transformer 基线 DA-TextSpotter,在规则与任意形状场景文本 spotting 基准上,无论准确率还是模型效率,均取得优于或与现有文本 spotting 架构相当的性能。数据集、代码与预训练模型将在录用后发布。

关键词

引用

@article{arxiv.2310.00558,
  title  = {Diving into the Depths of Spotting Text in Multi-Domain Noisy Scenes},
  author = {Alloy Das and Sanket Biswas and Umapada Pal and Josep Lladós},
  journal= {arXiv preprint arXiv:2310.00558},
  year   = {2024}
}

备注

Accepted to ICRA 2024