UPOCR:迈向统一的像素级 OCR 接口
计算机视觉与模式识别
2026-05-27 v2
摘要
现有的光学字符识别(OCR)方法依赖于具有不同范式、架构和训练策略的特定任务设计,这显著增加了研究和维护的复杂性,并阻碍了在应用中的快速部署。为此,我们提出 UPOCR,一个简单而有效的通用模型,用于统一的像素级 OCR 接口。具体而言,UPOCR 将各种 OCR 任务的范式统一为图像到图像的转换,并将架构统一为基于视觉 Transformer (ViT) 且带有可学习任务提示的编码器-解码器。这些提示将编码器提取的通用特征表示推向特定任务空间,赋予解码器任务感知能力。此外,模型训练统一旨在最小化预测图像与真值图像之间的差异,而不考虑任务之间的不均匀性。实验在三个像素级 OCR 任务上进行,包括文本去除、文本分割和篡改文本检测。无需额外技巧,实验结果表明,所提出的方法可以使用统一的单一模型在三个任务上同时取得 SOTA 性能,这为未来通用 OCR 模型的研究提供了有价值的策略和见解。代码可在 https://github.com/shannanyinxiang/UPOCR 获取。
引用
@article{arxiv.2312.02694,
title = {UPOCR: Towards Unified Pixel-Level OCR Interface},
author = {Dezhi Peng and Zhenhua Yang and Jiaxin Zhang and Chongyu Liu and Yongxin Shi and Kai Ding and Fengjun Guo and Lianwen Jin},
journal= {arXiv preprint arXiv:2312.02694},
year = {2026}
}
备注
ICML 2024 Version