中文

基于大语言模型的工业场景复杂合同信息提取

计算与语言 2025-07-11 v2

摘要

本文提出了一种针对工业场景下复杂合同信息提取任务的数据集构建方法,并基于此数据集微调大语言模型。首先,对工业合同文本进行聚类分析,并使用 GPT-4 和 GPT-3.5 从原始合同数据中提取关键信息,获得高质量的数据标注。其次,通过构建新文本实现数据增强,GPT-3.5 生成随机组合关键词后的非结构化合同文本,从而提高模型的鲁棒性。最后,基于高质量数据集微调大语言模型。实验结果表明,该模型在确保高字段召回率和精确率的同时,实现了卓越的整体性能,并考虑了解析效率。LoRA、数据平衡和数据增强有效提升了模型的准确率和鲁棒性。本文提出的方法为工业合同信息提取任务提供了一种新颖且高效的解决方案。

关键词

引用

@article{arxiv.2507.06539,
  title  = {Large Language Model for Extracting Complex Contract Information in Industrial Scenes},
  author = {Yunyang Cao and Yanjun Li and Silong Dai},
  journal= {arXiv preprint arXiv:2507.06539},
  year   = {2025}
}