知识图谱生成:结合大语言模型与本体工程用于文化遗产文本的学术争论
计算与语言
2026-04-09 v1 人工智能
数字图书馆
信息检索
摘要
文化遗产文本包含丰富的知识,由于将非结构化话语转换为结构化知识图谱(KG)的挑战,尚未实现系统化查询。本文引入ATR4CH(面向文化遗产的自适应文本到RDF转换),一种基于大型语言模型的文化遗产文档知识提取的系统性五步方法。我们通过关于真实性评估争论的案例研究验证了该方法。方法论-A TR4CH将注释模型、本体框架与大型语言模型提取相结合,通过迭代开发实现:基础分析、注释模式开发、管线架构、集成细化和全面评估。我们采用关于争议性项目(文档、文物等)的维基百科文章实现了该方法,构建一个包含三个大型语言模型(Claude Sonnet 3.7、Llama 3.3 70B、GPT-4o-mini)的顺序管线。发现-A TR4CH成功提取复杂的文化遗产知识:元数据提取达0.96-0.99 F1分,实体识别达0.7-0.8 F1分,假设提取达0.65-0.75 F1分,证据提取达0.95-0.97 F1分,话语表示达0.62 G-EVAL。较小模型表现出竞争力,实现了成本效益的部署。原创性-这是首个将大型语言模型提取与文化遗产本体协调的系统性方法。ATR4CH提供了一个可跨域适配、适应机构资源的可复制框架。研究限制-生成的知识图谶仅限于维基百科文章。尽管结果令人鼓舞,但在后处理期间仍需人工监督。实际意义-A TR4CH使文化遗产机构能够系统性地将文本知识转换为可查询的知识图谱,支持自动化元数据丰富和知识发现。
引用
@article{arxiv.2511.10354,
title = {Knowledge Graphs Generation from Cultural Heritage Texts: Combining LLMs and Ontological Engineering for Scholarly Debates},
author = {Andrea Schimmenti and Valentina Pasqual and Fabio Vitali and Marieke van Erp},
journal= {arXiv preprint arXiv:2511.10354},
year = {2026}
}
备注
46 pages