中文

Extract-0:一个用于文档信息提取的专用语言模型

计算与语言 2025-09-30 v1 人工智能

摘要

本文介绍了Extract-0,这是一个拥有70亿参数的语言模型,专门为文档信息提取进行了优化,其性能超过了参数数量大几个数量级的模型。通过合成数据生成、使用低秩适应(LoRA)的监督微调以及通过分组相对策略优化(GRPO)的强化学习的新颖组合,Extract-0在包含1000个多样化文档提取任务的基准测试中取得了0.573的平均奖励,优于GPT-4.1(0.457)、o3(0.464)和GPT-4.1-2025(0.459)。该训练方法采用了一个保留记忆的合成数据生成流水线,从多样化的文档来源生成了280,128个训练样本,随后进行参数高效微调,仅修改了0.53%的模型权重(76.6亿参数中的4040万)。强化学习阶段引入了一种基于语义相似度的新型奖励函数,用于处理信息提取任务中固有的歧义性。这项研究表明,特定任务的优化可以产生超越通用系统的模型,同时所需的计算资源大大减少。

关键词

引用

@article{arxiv.2509.22906,
  title  = {Extract-0: A Specialized Language Model for Document Information Extraction},
  author = {Henrique Godoy},
  journal= {arXiv preprint arXiv:2509.22906},
  year   = {2025}
}