中文

针对湖南历史名人的人类学知识图谱构建的大型语言模型监督微调研究

计算与语言 2025-11-24 v1 人工智能

摘要

大型语言模型和知识图谱为通过支持从文献中提取、分析和解释文化遗产,为研究历史文化提供了巨大潜力。以湖南由徐湘文化塑造的现代历史名人为案例研究,预训练的大型模型可帮助研究人员高效地从文本来源中提取关键信息,包括生平属性、生命事件和社会关系,并构建结构化知识图谱。然而,湖南历史名人的系统性数据资源仍有限,通用模型在此类低资源环境下在领域知识提取和结构化输出生成方面往往表现不佳。为此,本文提出一种监督式微调方法以增强领域特定信息提取。首先,我们设计针对湖南历史名人领域的细粒度、模式导向的指令模板,并构建指令调优数据集以弥补领域特定训练语料的不足。其次,我们对四个公开的大型语言模型——Qwen2.5-7B、Qwen3-8B、DeepSeek-R1-Distill-Qwen-7B和Llama-3.1-8B-Instruct——应用参数高效指令微调,并开发评估标准以衡量其提取性能。实验结果表明,所有模型在微调后均表现出显著的性能提升。其中,Qwen3-8B达到了89.3866的最高分,采用100个样本和50次训练迭代。本研究为针对区域历史和文化领域的垂直大型语言模型微调提供了新见解,并凸显了其在文化遗产知识提取和知识图谱构建中的成本效益应用潜力。

关键词

引用

@article{arxiv.2511.17012,
  title  = {Supervised Fine Tuning of Large Language Models for Domain Specific Knowledge Graph Construction:A Case Study on Hunan's Historical Celebrities},
  author = {Junjie Hao and Chun Wang and Ying Qiao and Qiuyue Zuo and Qiya Song and Hua Ma and Xieping Gao},
  journal= {arXiv preprint arXiv:2511.17012},
  year   = {2025}
}