PILOT:一种可提示的交错布局感知 OCR Transformer
计算机视觉与模式识别
2026-04-20 v2
摘要
传统 OCR 流水线将文档阅读分解为检测、分割和识别三个阶段,这使其对定位错误敏感,且难以扩展到交互式查询。本文探究了能否用一个紧凑的单一模型在手写与印刷文档上联合执行文本识别与空间定位。我们提出了 PILOT,一个具有 1.55 亿参数的可提示条件生成模型,它将文档 OCR 建模为统一的序列生成任务。一个轻量级的深度可分离 CNN 对页面进行编码,Transformer 解码器自回归地在 10 px 网格上输出子词与量化绝对坐标令牌的单一序列流,从而在统一架构中实现全页 OCR、区域条件读取以及按字符串查询定位。一个由纯转录到文本-框联合生成、再到提示控制提取的三阶段课程学习策略稳定了训练并提升了空间定位精度。在 IAM、RIMES 2009、SROIE 2019 以及异构的 MAURDOR 基准上的实验表明,与传统 OCR 系统、近期端到端 HTR 模型以及紧凑型视觉-语言模型相比,PILOT 在文本识别与行级检测方面取得了具有竞争力或更优的性能,同时其规模仍远小于十亿参数级的多模态模型。在细粒度 OCR 与按字符串查询定位任务上的进一步评估进一步证实,统一的文本-布局解码器能够在紧凑的设定下提供准确且高效的可提示 OCR。为支持可复现性,我们公开了合成 SROIE 生成器、50 万页带标注的 IDL/PDFA 页面、IAM、RIMES 2009 与 MAURDOR 的统一行级标注,以及源代码 https://github.com/hamdilaziz/PILOT。
引用
@article{arxiv.2504.03621,
title = {PILOT: A Promptable Interleaved Layout-aware OCR Transformer},
author = {Laziz Hamdi and Amine Tamasna and Pascal Boisson and Thierry Paquet},
journal= {arXiv preprint arXiv:2504.03621},
year = {2026}
}