中文

从历史文件自动创建知识图谱:以智利独裁时期为案例研究

计算机与社会 2024-08-23 v1

摘要

我们呈现了关于从与智利独裁时期(1973-1990)相关的历史文件中自动构建知识图谱的结果。我们的方法包括利用大语言模型(LLM)自动识别实体及这些实体之间的关系,并执行这些值的解析。为了防止幻觉,我们将LLM的交互 grounded 在一个包含4种实体类型和7种关系类型的简单本体中。为了评估我们的架构,我们使用一小部分文档构建的黄金标准图谱,并将其与我们的方案在处理同一文档集时获得的图谱进行比较。结果表明,自动构建的图谱能够识别黄金标准中大部分实体,而那些未被识别的实体大多是由于图谱中信息结构的细粒度导致的,而不是自动方案遗漏了重要实体。展望来看,我们期望本报告将鼓励开展其他类似项目,以增强人文科学和社会科学领域的研究,但我们指出需要更好的评估指标来准确地微调此类架构。

关键词

引用

@article{arxiv.2408.11975,
  title  = {Automatic knowledge-graph creation from historical documents: The Chilean dictatorship as a case study},
  author = {Camila Díaz and Jocelyn Dunstan and Lorena Etcheverry and Antonia Fonck and Alejandro Grez and Domingo Mery and Juan Reutter and Hugo Rojas},
  journal= {arXiv preprint arXiv:2408.11975},
  year   = {2024}
}

备注

11 pages, 1 figure, 2 tables. Paper submitted to KBC-LM 2024