中文

倾斜文档结构化数据提取的鲁棒性

计算机视觉与模式识别 2026-01-06 v1 计算与语言 机器学习

摘要

从文档中提取数据的光学字符识别 (OCR) 是智能信息化的关键任务,如医疗记录数字化与道路标志识别。多模态大型语言模型 (LLM) 能解决此任务且已展现出卓越性能。近期发现,多模态 LLM 的数据提取准确率会受到文档平面旋转的影响。然而,真实世界的文档图像通常不仅平面旋转,还存在透视畸变。本研究探讨了此类扰动对数据提取准确率的影响,针对最先进模型 Gemini-1.5-pro 进行测试。由于透视畸变具有高度自由度,设计实验的难度大于单参数旋转。我们观察到文档图像的典型畸变,并指出大多数畸变约遵循等腰梯形变换,这使我们能够以少量参数评估畸变。我们将独立参数从八个减少至两个,即旋转角度与畸变比率。随后,从合成生成的样本文档中提取特定实体。就 LLM 性能而言,我们评估了字符识别准确率以及结构识别准确率。前者代表经典的 OCR 指标,后者与阅读顺序正确性相关。特别是,结构识别准确率因文档畸变而显著下降。此外,我们发现通过简单的旋转校正可提升此准确率。这一洞见将助力多模态 LLM 在 OCR 任务中的实际应用。

关键词

引用

@article{arxiv.2511.17607,
  title  = {Robustness of Structured Data Extraction from Perspectively Distorted Documents},
  author = {Hyakka Nakada and Yoshiyasu Tanaka},
  journal= {arXiv preprint arXiv:2511.17607},
  year   = {2026}
}

备注

8 pages, 12 figures