中文

直视:面向高效 OCR 的文档方向检测

计算机视觉与模式识别 2026-03-17 v2 计算与语言

摘要

尽管在文档理解方面取得了显著进展,但在实际场景中确定扫描或拍摄文档的正确方向仍是关键的预处理步骤。准确的旋转校正对于增强下游任务(如光学字符识别 OCR)的性能至关重要,因为由于用户错误(尤其是捕获时相机的错误基准方向)常导致误对齐。在本研究中,我们首先引入 OCR-Rotation-Bench (ORB),一个用于评估 OCR 对图像旋转鲁棒性的新基准,包括 (i) 基于旋转变换后的结构化和非结构化英文 OCR 数据集构建的 ORB-En,以及 (ii) 涵盖 11 种印度语言中偏向中低资源语言的新型多语言数据集 ORB-Indic。我们还提出了一条快速、稳健且轻量级的旋转分类管道,基于 Phi-3.5-Vision 模型的视觉编码器,采用动态图像裁切技术,专为 4 类旋转任务进行独立式微调。我们的方法在两个数据集上分别实现了近 96% 和 92% 的准确率,用以识别旋转方向。除了分类之外,我们还展示了该模块在提升 OCR 性能中的关键作用:闭源模型(最高提升 14%)和开源权重模型(最高提升 4 倍)在模拟实际场景中均显示出显著优势。

关键词

引用

@article{arxiv.2511.04161,
  title  = {Seeing Straight: Document Orientation Detection for Efficient OCR},
  author = {Suranjan Goswami and Abhinav Ravi and Raja Kolla and Ali Faraz and Shaharukh Khan and Akash and Chandra Khatri and Shubham Agarwal},
  journal= {arXiv preprint arXiv:2511.04161},
  year   = {2026}
}