中文

CM1——用于评估大型视觉语言模型小样本信息提取能力的数据集

计算机视觉与模式识别 2025-05-08 v1

摘要

从手写文档中自动提取键值信息是文档分析中的一项关键挑战。可靠的提取是许多档案馆大规模数字化工作的前提。大型视觉语言模型(LVLM)是一种很有前景的技术,可用于解决这一问题,尤其是在标注训练数据稀缺的场景中。在本工作中,我们提出了一个专门设计用于评估LVLM少样本能力的新型数据集。CM1文档是一批历史表格收藏,其中包含手写条目,于二战后在欧洲创建,用于管理“关怀与维护”计划。该数据集建立了三个关于提取姓名和出生日期信息的基准,并考虑了不同的训练集大小。我们提供了两种不同LVLM的基线结果,并将性能与一个已有的整页提取模型进行了比较。虽然传统的整页模型取得了极具竞争力的性能,但我们的实验表明,当只有少量训练样本可用时,所考虑的LVLM得益于其规模和大量预训练,性能优于经典方法。

关键词

引用

@article{arxiv.2505.04214,
  title  = {CM1 -- A Dataset for Evaluating Few-Shot Information Extraction with Large Vision Language Models},
  author = {Fabian Wolf and Oliver Tüselmann and Arthur Matei and Lukas Hennies and Christoph Rass and Gernot A. Fink},
  journal= {arXiv preprint arXiv:2505.04214},
  year   = {2025}
}