面向低资源环境的多任务结构化信息抽取:基于十亿参数指令微调模型
计算与语言
2025-09-11 v1 人工智能
摘要
在金融合规报告、法律文件分析和多语言知识库构建等领域部署大型语言模型(LLM)进行结构化数据抽取,往往不切实际,因为 smaller teams 受限于运行大型架构的高昂成本以及准备大量高质量数据集的困难。目前大多数指令微调研究聚焦于七亿参数或更大模型,关于更小模型在低资源、多任务条件下是否能可靠工作的证据有限。本文提出 ETLCH,一个基于十亿参数的 LLaMA 模型,通过低秩适应在每项任务上仅使用几百至一千个样本进行微调,以实现 JSON 抽取、知识图谱抽取和命名实体识别。尽管模型规模较小,ETLCH 在大多数评估指标上均优于强大基线,尤其在最低数据规模下也观察到显著提升。这些发现表明,经过良好微调的小模型可以在较低计算成本下交付稳定且准确的结构化输出,使其在资源受限环境中实现成本效益高且可靠的信息抽取管道。
引用
@article{arxiv.2509.08381,
title = {Low-Resource Fine-Tuning for Multi-Task Structured Information Extraction with a Billion-Parameter Instruction-Tuned Model},
author = {Yu Cheng Chih and Yong Hao Hou},
journal= {arXiv preprint arXiv:2509.08381},
year = {2025}
}
备注
13 pages, 8 figures, includes experiments on JSON extraction, knowledge graph extraction, and NER