中文

将通用多模态预训练模型迁移至文本识别

计算机视觉与模式识别 2022-12-20 v1

摘要

本文提出了一种名为OFA-OCR的新方法,用于将多模态预训练模型迁移至文本识别。具体而言,我们将文本识别重新定义为图像描述任务,并直接将一个统一的视觉-语言预训练模型迁移到最终任务。无需在大规模标注或合成的文本识别数据上进行预训练,OFA-OCR就超越了基线模型,并在中文文本识别基准测试中达到了最先进的性能。此外,我们利用OFA-OCR构建了一个OCR流程,并证明其可以达到与产品级API相竞争的性能。代码(https://github.com/OFA-Sys/OFA)和演示(https://modelscope.cn/studios/damo/ofa_ocr_pipeline/summary)已公开发布。

关键词

引用

@article{arxiv.2212.09297,
  title  = {Transferring General Multimodal Pretrained Models to Text Recognition},
  author = {Junyang Lin and Xuancheng Ren and Yichang Zhang and Gao Liu and Peng Wang and An Yang and Chang Zhou},
  journal= {arXiv preprint arXiv:2212.09297},
  year   = {2022}
}