从手写到结构化数据:基准化 AI 对手写表格的识别
计算机视觉与模式识别
2026-04-21 v1 机器学习
摘要
手工 digitization 结构化手写文档效率低下且成本高昂。本文对 17 家领先的多模态大型语言模型及开源模型进行了基准测试,针对的是这一类极具挑战性的真实医疗表格:其中混合包含日期、结构化打印文本、手写答案以及显著的变体性。较小或较旧的模型表现不佳,但最新的 Google 与 OpenAI 模型在离散或预定义字段上实现约 85% 的准确率,加权 F1 分数约为 90%。明确的任务特定优势显现:GPT-5.4 在噪声日期提取方面表现突出,同时保持最低的幻觉率(6%);Claude Sonnet 4.6 在格式化字段(日期和数值)上平均表现最佳;Gemini 3.1 在整体性能上领先,误差率最低(WER = 0.50,CER = 0.31),且在离散分类指标上成绩最为优异。我们进一步表明,提示词优化可使宏观精确率、召回率和 F1 分数提升超过 60%,但对加权指标影响有限(仅提升约 2-5%)。这些结果表明,多模态大型语言模型的快速进步为实现对复杂手写工作流程的全自动化提供了具竞争力的路径,尤其适用于中低收入国家。
引用
@article{arxiv.2604.16504,
title = {From Handwriting to Structured Data: Benchmarking AI Digitisation of Handwritten Forms},
author = {Nicholas Pather and Joshua Fouché and Sitwala Mundia and Karl-Günter Technau and Thokozile Malaba and Alex Welte and Ushma Mehta and Bruce A. Bassett},
journal= {arXiv preprint arXiv:2604.16504},
year = {2026}
}
备注
19 Pages, 5 Figures