跨书籍的关系抽取以重建社区网络:AffilKG 数据集
计算与语言
2025-05-19 v1
摘要
当知识图谱(KG)从文本中自动抽取时,它们的准确性是否足以用于下游分析?不幸的是,当前的标注数据集无法用于评估此问题,因为它们的知识图谱高度不连通、规模太小或过于复杂。为此,我们引入 AffilKG(https://doi.org/10.5281/zenodo.15427977),这是一组六个数据集,是首批将完整书籍扫描与大规模标记知识图谱配对的数据集。每个数据集都包含成员关系(Member relationships)的 affiliation 图,这类简易知识图谱捕捉 Person 与 Organization 实体之间的关系——在迁徙、社区互动及其他社会现象研究中非常有用。此外,三组数据集包括更广泛的关系类型的扩展知识图谱。我们的初步实验表明,模型性能在不同数据集之间存在显著变异,这凸显了 AffilKG 能够实现两项关键突破:(1)基准测试提取误差如何传播到图层面分析(例如社区结构),以及 (2)为实际社会科学研究验证知识图谱抽取方法。
引用
@article{arxiv.2505.10798,
title = {Relation Extraction Across Entire Books to Reconstruct Community Networks: The AffilKG Datasets},
author = {Erica Cai and Sean McQuade and Kevin Young and Brendan O'Connor},
journal= {arXiv preprint arXiv:2505.10798},
year = {2025}
}