中文

利用多语言数据集进行预训练以提升文本 spotting 性能

计算机视觉与模式识别 2023-11-02 v4

摘要

当部署到真实世界条件时,对广泛领域的适应能力对场景文本 spotting 模型至关重要。然而,现有的最先进(SOTA)方法通常仅通过在自然场景文本数据集上预训练来简单整合场景文本检测与识别,并未直接利用多领域之间的中间特征表示。在此,我们研究域自适应场景文本 spotting 问题,即在多领域源数据上训练模型,使其能直接适应目标领域,而非专用于特定领域或场景。进一步,我们研究了一个称为 Swin-TESTR 的 transformer 基线,专注于解决规则与任意形状场景文本的场景文本 spotting 问题,并进行了详尽评估。结果清晰展示了中间表示在多个领域(如语言、合成到真实、文档)的文本 spotting 基准上取得显著性能表现的潜力,无论是在准确性还是效率方面。

关键词

引用

@article{arxiv.2310.00917,
  title  = {Harnessing the Power of Multi-Lingual Datasets for Pre-training: Towards Enhancing Text Spotting Performance},
  author = {Alloy Das and Sanket Biswas and Ayan Banerjee and Josep Lladós and Umapada Pal and Saumik Bhattacharya},
  journal= {arXiv preprint arXiv:2310.00917},
  year   = {2023}
}

备注

Accepted to the 2024 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2024)