OCRGenBench:用于评估 OCR 生成能力的全面基准
计算机视觉与模式识别
2026-03-24 v4
摘要
改进视觉文本合成一直是图像生成模型面临的挑战性且不断演进的前沿。尽管近期的 SOTA 模型在文本生成能力上取得了显著进展,但现有基准由于范围狭窄(仅涵盖场景文本和海报)、评估孤立(仅分别评估文本到图像生成或编辑)以及难度不足(缺乏具有挑战性的场景),无法充分评估其真实性能。为弥合这一差距,我们首次将文本导向的文本到图像生成、文本编辑和 OCR 相关图像到图像翻译统一,以评估模型在整体视觉文本合成能力,即 OCR 生成能力。据此,我们提出了 OCRGenBench,迄今为止最全面的基准,用于评估这些能力。OCRGenBench 涵盖五类常见文本类别和 33 项 OCR 生成任务,包括文本到图像生成、文本编辑以及其他图像到图像 OCR 任务(如文档展开和手写体去除)。该基准包含 1,060 份人工标注样本,包含指令-图像-真实值三元组,特意设计具有高文本密度、多样化生成规模、不同宽高比以及双语内容,以捕捉真实世界的复杂性。此外,我们引入 OCRGenScore 作为统一指标,集成文本准确性、审美质量和指令遵循度。对 19 个最前沿生成模型进行大量实验发现,大多数模型得分不足 60 分。我们的分析揭示了关键且此前被忽视的局限性,包括文本定位不良、意外内容修改以及对密集或小规模文本的失效。我们希望 OCRGenBench 能建立稳健的标准,以评估 OCR 生成能力,推动可靠视觉文本合成的演进。该基准及评估代码已公开于 https://github.com/NiceRingNode/Awesome-Generative-Models-for-OCR。
引用
@article{arxiv.2507.15085,
title = {OCRGenBench: A Comprehensive Benchmark for Evaluating OCR Generative Capabilities},
author = {Peirong Zhang and Haowei Xu and Jiaxin Zhang and Xuhan Zheng and Guitao Xu and Yuyi Zhang and Junle Liu and Zhenhua Yang and Wei Zhou and Lianwen Jin},
journal= {arXiv preprint arXiv:2507.15085},
year = {2026}
}