SLHCat:利用语义、词汇与层次特征将维基百科分类与列表映射到 DBpedia
数字图书馆
2023-09-28 v2 计算与语言
摘要
维基百科文章通过分类与列表进行层次化组织,提供了最为全面和通用的分类体系之一,但其开放创建方式导致了冗余与不一致。将 DBpedia 类分配给维基百科分类与列表可缓解该问题,从而构建一个大型知识图谱,该图谱对于通过实体链接与类型标注对数字内容进行分类至关重要。然而,现有的 CaLiGraph 方法生成的映射不完整且粒度不够细。在本文中,我们将该问题视为本体对齐,利用知识图谱的结构信息以及本体类名的词汇与语义特征来发现高置信映射,进而以远程监督方式用于微调预训练语言模型。我们的方法 SLHCat 由两部分组成:1) 利用知识图谱结构、语义相似度与命名实体类型标注自动生成训练数据。2) 在训练数据上对预训练语言模型 BERT 进行微调与提示微调,以捕捉类名的语义与句法属性。我们的模型 SLHCat 在一个通过标注 3000 对细粒度 CaLiGraph-DBpedia 映射对构建的基准数据集上进行评估。SLHCat 在准确率上以 25% 的大幅优势超越基线模型,为大规模本体映射提供了实用方案。
引用
@article{arxiv.2309.11791,
title = {SLHCat: Mapping Wikipedia Categories and Lists to DBpedia by Leveraging Semantic, Lexical, and Hierarchical Features},
author = {Zhaoyi Wang and Zhenyang Zhang and Jiaxin Qin and Mizuho Iwaihara},
journal= {arXiv preprint arXiv:2309.11791},
year = {2023}
}
备注
ICADL23