Platypus:一种用于阅读多种形式文本的泛化专家模型
计算机视觉与模式识别
2024-08-28 v1
摘要
从图像(无论是自然场景还是文档)中阅读文本,由于高技术挑战和广泛的应用范围,数十年来一直是研究热点。此前,通常开发独立的专家模型来处理文本阅读的子任务(例如场景文本识别、手写文本识别和数学表达式识别)。然而,这类专家模型通常无法有效泛化到不同的子任务上。近期,以统一方式在海量数据上训练的通用模型(如GPT-4V)在阅读各种场景下的文本方面展现出巨大潜力,但存在精度有限和效率低下的缺点。在本工作中,我们提出了Platypus,一种用于文本阅读的泛化专家模型。具体而言,Platypus结合了两全其美的优势:既能用单一统一架构识别各种形式的文本,又能实现卓越的精度和高效率。为了更好地发挥Platypus的优势,我们还构建了一个文本阅读数据集(称为Worms),其图像从先前数据集中整理而来并进行了部分重新标注。在标准基准上的实验证明了所提出的Platypus模型的有效性和优越性。模型和数据将在https://github.com/AlibabaResearch/AdvancedLiterateMachinery/tree/main/OCR/Platypus上公开。
引用
@article{arxiv.2408.14805,
title = {Platypus: A Generalized Specialist Model for Reading Text in Various Forms},
author = {Peng Wang and Zhaohai Li and Jun Tang and Humen Zhong and Fei Huang and Zhibo Yang and Cong Yao},
journal= {arXiv preprint arXiv:2408.14805},
year = {2024}
}
备注
Accepted by ECCV2024