在多语言含噪 OCR 数据上评估 LLM 问答的鲁棒性
计算与语言
2025-09-22 v3
摘要
光学字符识别(OCR)在数字化历史和多语言文档中发挥着关键作用,然而 OCR 错误——包括字符插入、删除和替换在内的不完美文本提取——会严重影响问答(QA)等下游任务。在这项工作中,我们对 OCR 引入的噪声如何影响多语言 QA 系统的性能进行了全面分析。为支持此分析,我们引入了一个多语言 QA 数据集 MultiOCR-QA,包含三种语言(英语、法语和德语)的 5 万个问答对。该数据集由经过 OCR 处理的历史文档整理而成,包含不同级别和类型的 OCR 噪声。随后,我们评估了不同的 SOTA 大型语言模型(LLM)在不同错误条件下的表现,重点关注三种主要 OCR 错误类型。我们的发现表明,QA 系统极易受到 OCR 引入错误的影响,在含噪 OCR 文本上表现不佳。通过比较模型在干净文本与含噪文本上的表现,我们深入了解了当前方法的局限性,并强调了在历史数字化背景下对更具抗噪能力的 QA 系统的需求。
引用
@article{arxiv.2502.16781,
title = {Evaluating Robustness of LLMs in Question Answering on Multilingual Noisy OCR Data},
author = {Bhawna Piryani and Jamshid Mozafari and Abdelrahman Abdallah and Antoine Doucet and Adam Jatowt},
journal= {arXiv preprint arXiv:2502.16781},
year = {2025}
}
备注
Accepted at CIKM 2025