中文

DocRevive:文档文本恢复统一管道

计算机视觉与模式识别 2026-05-25 v2

摘要

在文档理解领域,重建受损、遮挡或不完整文本的挑战仍是一个关键且尚未被充分探索的问题。后续的文档理解任务可以从文档重建过程受益。为此,本文提出了一种新型统一管道,结合最先进的光学字符识别(OCR)、先进的图像分析、掩码语言模型和扩散模型,以恢复和重构文本,同时保持视觉完整性。我们创建了一个包含 30,078 张退化文档图像的合成数据集,模拟多样化的文档退化情景,为恢复任务设定基准。我们的管道检测并识别文本,识别退化情况并使用遮挡检测器,随后使用填充模型进行语义连贯的重构。扩散模块无缝重新集成文本,匹配字体、大小和对齐方式。为评估恢复质量,我们提出了统一上下文相似度指标(UCSM),该指标融合了编辑相似度、语义相似度和长度相似度,并包含一种上下文可预测性度量,用于惩罚在正确文本在上下文中显而易见时出现的偏差。我们的工作推动了文档恢复技术,促进了档案研究和数字保存,同时为文本重构设定了新标准。OPRB 数据集和代码分别可在 \href{https://huggingface.co/datasets/kpurkayastha/OPRB}{Hugging Face} 和 \href{https://github.com/kunalpurkayastha/DocRevive}{Github} 获取。

关键词

引用

@article{arxiv.2604.10077,
  title  = {DocRevive: A Unified Pipeline for Document Text Restoration},
  author = {Kunal Purkayastha and Ayan Banerjee and Josep Llados and Umapada Pal},
  journal= {arXiv preprint arXiv:2604.10077},
  year   = {2026}
}