从识别到推理:面向真实世界收据文档理解的MLLMs基准测试与提升
计算机视觉与模式识别
2026-05-22 v1
摘要
从视觉文档中提取结构化信息(视觉信息提取,VIE)是业务自动化的基石。虽然最近的多模态大语言模型(MLLMs)显示出有前景的能力,但现有的基准测试在规模和真实性方面存在严重局限,缺乏语义粒度,且未覆盖多样化的文档类型。为弥合这一差距,我们引入ReceiptBench,一个大规模的人工标注基准,包含1万份多样化收据,将信息提取组织为四个层次子任务:(1)基本感知,用于原始文本检测,(2)格式归一化,用于严格遵循标准化指令,(3)语义推理,用于从上下文中推断隐含属性,(4)结构解析,用于处理嵌套的行项目。此外,我们提出了一种两阶段训练框架,集成度量感知的分组相对策略优化(GRPO),将严格的评估约束转化为强化学习信号,以增强结构一致性。广泛的实验表明,我们的方法在状态-of-the-art性能,超越了领先的专有模型在复杂推理任务上的表现。我们在https://github.com/wwwT0ri/ReceiptBench发布了数据集和代码。
引用
@article{arxiv.2605.22413,
title = {From Recognition to Reasoning: Benchmarking and Enhancing MLLMs on Real-World Receipt Document Understanding},
author = {Yandi Wang and Libin Zhan and Ziwei Huang and Tiancheng Luo and Yuxuan Jiang and Wang Dong and Leilei Gan and Jun Chen},
journal= {arXiv preprint arXiv:2605.22413},
year = {2026}
}