中文

知识图谱提取误差对下游图分析影响的理解:关于组织关联图的案例研究

计算与语言 2025-06-17 v1 社会与信息网络

摘要

知识图谱(KGs)在社会学、公共卫生等多个领域用于分析社会结构、社区动态、机构成员关系及其他复杂关系。虽然近期大语言模型(LLMs)的进展提高了从大规模文本语料库中自动提取KG的可扩展性和可获取性,但提取误差对下游分析的影响仍鲜为人知,尤其是依赖准确KG以获取实际见解的应用科学家。为此,我们在两个层面上评估了KG提取性能:(1)微观层面的边准确性,符合标准NLP评估,并手动识别常见误差来源;(2)宏观层面的图度量,评估结构属性如社区检测和连通性,这些属性与实际应用相关。我们聚焦于从社会登记簿中提取的人组织成员关联图。我们的研究识别出一范围内的提取性能,使得大多数下游图分析度量的偏差接近零。然而,随着提取性能下降,我们发现许多度量显示出日益显著的偏差,每种度量倾向于一致地向过度或不足估计的方向发展。通过仿真,我们进一步表明文献中常用的误差模型未能捕捉这些偏差模式,表明需要更真实的KG提取误差模型。我们的发现为实践者提供了可操作的见解,凸显了推动提取方法和误差建模进步的重要性,以确保下游分析可靠且有意义。

关键词

引用

@article{arxiv.2506.12367,
  title  = {Understanding the Effect of Knowledge Graph Extraction Error on Downstream Graph Analyses: A Case Study on Affiliation Graphs},
  author = {Erica Cai and Brendan O'Connor},
  journal= {arXiv preprint arXiv:2506.12367},
  year   = {2025}
}

备注

30 pages