中文

ODM:一种面向场景文本检测与识别的文本 - 图像进一步对齐预训练方法

计算机视觉与模式识别 2024-04-18 v2

摘要

近年来,文本 - 图像联合预训练技术在各种任务中展现出良好的效果。然而,在光学字符识别(OCR)任务中,将文本实例与其在图像中对应的文本区域进行对齐是一项挑战,因为它需要文本与 OCR-Text(指图像中的文本,以区别于自然语言中的文本)之间的有效对齐,而非对整体图像内容的 holistic 理解。本文提出了一种名为 OCR-Text 去风格化建模(OCR-Text Destylization Modeling, ODM)的新预训练方法,该方法基于文本提示将图像中发现的多样化文本风格转换为统一风格。借助 ODM,我们实现了文本与 OCR-Text 之间更好的对齐,并使预训练模型能够适应场景文本检测和识别任务中复杂多样的风格。此外,我们专门为 ODM 设计了一种新的标签生成方法,并将其与我们提出的 Text-Controller 模块相结合,以解决 OCR 任务中的标注成本挑战,从而使更大规模的无标签数据能够参与预训练。在多个公共数据集上的大量实验表明,我们的方法显著提升了性能,并在场景文本检测和识别任务中优于当前的预训练方法。代码地址:https://github.com/PriNing/ODM。

关键词

引用

@article{arxiv.2403.00303,
  title  = {ODM: A Text-Image Further Alignment Pre-training Approach for Scene Text Detection and Spotting},
  author = {Chen Duan and Pei Fu and Shan Guo and Qianyi Jiang and Xiaoming Wei},
  journal= {arXiv preprint arXiv:2403.00303},
  year   = {2024}
}

备注

Accepted by CVPR2024