基于历史文本知识图谱的图检索增强生成研究
计算与语言
2025-06-19 v1
摘要
本文针对计算人文学科和 AIGC 技术背景下通用大语言模型在历史文本分析中存在的领域知识缺口问题,提出了 Graph RAG 框架,融合链式思考提示、自指令生成和过程监督机制,构建了一个需极少人工标注的《四史》人物关系数据集。该数据集支持自动化的历史知识提取,显著降低了人工成本。在图增强生成阶段,我们引入了知识图谱与检索增强生成之间的协同机制,提高了通用模型与历史知识的对齐度。实验表明,采用简体中文输入和链式思考提示的领域模型 Xunzi-Qwen1.5-14B 在关系抽取任务中取得最佳性能(F1=0.68)。集成 GraphRAG 的 DeepSeek 模型在开放域 C-CLUE 关系抽取数据集上 F1 提升 11%(0.08-0.19),超越 Xunzi-Qwen1.5-14B(0.12),有效缓解了幻觉现象,提升了解读性。该框架为古典文本知识抽取提供了低资源解决方案,推动了历史知识服务和人文研究的发展。
引用
@article{arxiv.2506.15241,
title = {Research on Graph-Retrieval Augmented Generation Based on Historical Text Knowledge Graphs},
author = {Yang Fan and Zhang Qi and Xing Wenqian and Liu Chang and Liu Liu},
journal= {arXiv preprint arXiv:2506.15241},
year = {2025}
}