中文

使用通用大型语言模型从电费账单中进行信息抽取

计算与语言 2026-04-30 v1

摘要

从半结构化商业文档中抽取信息仍是企业管理面临的关键挑战。本研究评估了通用大型语言模型(LLM)在无需特定任务微调的情况下,从西班牙语电费账单中抽取结构化信息的能力。我们使用 IDSEM 数据集的一个子集,对架构截然不同的两个模型 Gemini 1.5 Pro 和 Mistral-small 进行了基准测试,涵盖 19 种参数配置和 6 种提示策略。我们的实验框架将提示工程作为主要实验变量,比较了零样本基线与日益复杂的少样本方法及迭代抽取策略。结果表明,提示质量的影响远超超参数调优:所有参数配置间的 F1 分数差异微乎其微,而零样本与最佳少样本策略之间的差距超过 19 个百分点。最佳配置(带交叉验证的少样本)在 Gemini 上实现了 97.61% 的 F1 分数,在 Mistral-small 上实现了 96.11%,其中文档模板结构是决定抽取难度的主要因素。这些发现表明,提示设计是最大化基于 LLM 的文档处理中抽取保真度的关键杠杆,从而为将通用 LLM 集成到商业文档自动化中提供了实证框架。

关键词

引用

@article{arxiv.2604.25927,
  title  = {Information Extraction from Electricity Invoices with General-Purpose Large Language Models},
  author = {Javier Gómez and Javier Sánchez},
  journal= {arXiv preprint arXiv:2604.25927},
  year   = {2026}
}

备注

13 pages, 2 figures