中文

基于多模态 LLM 的历史数据集构建:德国专利 (1877-1918)

综合经济学 2025-12-23 v1 计算机视觉与模式识别 数字图书馆 经济学

摘要

我们利用多模态大型语言模型 (LLM) 从 9,562 份档案扫描图像中构建包含 306,070 份德国专利 (1877-1918) 数据集,采用由 Gemini-2.5-Pro 和 Gemini-2.5-Flash-Lite 提供动力的 LLM 驱动的管道。我们的基准测试提供了初步证据表明,多模态 LLM 可以创建高于我们的研究助理更高质量的数据集,同时在从图像语料库构建专利数据集方面速度快 795 倍以上,成本低 205 倍。每页约嵌入 20-50 项专利条目,采用双栏格式排版,使用哥特体和罗马字体印刷。我们 primary source 材料的字体与布局复杂度表明,多模态 LLM 可能是数据集构建的范式转变。我们开源了我们的基准测试和专利数据集以及 LLM 驱动的数据管道,该管道可轻易适配其他图像语料库,使用 LLM 辅助编码工具,降低非技术研究人员的准入门槛。最后,我们解释了部署 LLM 进行历史数据集构建的经济学,并对该领域的潜在影响持深思熟虑的展望。

关键词

引用

@article{arxiv.2512.19675,
  title  = {Multimodal LLMs for Historical Dataset Construction from Archival Image Scans: German Patents (1877-1918)},
  author = {Niclas Griesshaber and Jochen Streb},
  journal= {arXiv preprint arXiv:2512.19675},
  year   = {2025}
}