中文

知识图谱中的异常检测与分类

机器学习 2024-12-09 v1

摘要

知识图谱(KG)中的异常,如冗余、不一致、矛盾和缺失值,是不可避免的,因为这些图谱通常由人工整理,或通过机器学习和自然语言处理技术提取。因此,异常检测是一项可以提升 KG 质量的任务。在本文中,我们提出 SEKA(SEeking Knowledge graph Anomalies),一种用于检测 KG 中异常三元组和实体的无监督方法。SEKA 可以在保留覆盖范围的同时帮助提升 KG 的正确性。我们提出了路径排序算法(PRA)的一种适配版本,称为佐证路径排序算法(CPRA),它是 PRA 的高效适配,专门用于检测 KG 中的异常。此外,我们还提出了 TAXO(KG 中异常类型的分类法),一种 KG 中可能出现的异常类型的分类体系。该分类体系对 SEKA 发现的异常进行了分类,并广泛讨论了 KG 中可能存在的数据质量问题。我们在四个真实 KG(YAGO-1、KBpedia、Wikidata 和 DSKG)上评估了两种方法,以展示 SEKA 和 TAXO 超越基线的能力。

关键词

引用

@article{arxiv.2412.04780,
  title  = {Anomaly Detection and Classification in Knowledge Graphs},
  author = {Asara Senaratne and Peter Christen and Pouya Omran and Graham Williams},
  journal= {arXiv preprint arXiv:2412.04780},
  year   = {2024}
}