中文

面向开放知识库规范化的多视图聚类

计算与语言 2022-06-23 v1 人工智能

摘要

开放信息抽取(OIE)方法从非结构化文本中抽取大量OIE三元组<名词短语, 关系短语, 名词短语>,构成大型开放知识库(OKBs)。此类OKBs中的名词短语和关系短语未经规范化,导致事实分散且冗余。研究发现,知识的两种视图(即基于事实三元组的事实视图和基于事实三元组源上下文的上下文视图)提供了对OKB规范化任务至关重要的互补信息,该任务将同义名词短语和关系短语聚为同一组并赋予唯一标识符。然而,现有工作迄今孤立地利用了这两种知识视图。本文中,我们提出CMVC,一种新颖的无监督框架,联合利用这两种知识视图对OKB进行规范化,无需手动标注标签。为实现该目标,我们提出多视图CH K-Means聚类算法,通过考虑各视图不同的聚类质量,相互强化从每视图学到的特定视图嵌入的聚类。为进一步提升规范化性能,我们提出一种训练数据优化策略,从各特定视图的数据量和数据质量两方面分别以迭代方式精炼学到的特定视图嵌入。此外,我们提出Log-Jump算法,以数据驱动方式预测最优簇数而无需任何标签。我们在多个真实世界OKB数据集上对比最先进方法,通过大量实验证明了我们框架的优越性。

关键词

引用

@article{arxiv.2206.11130,
  title  = {Multi-View Clustering for Open Knowledge Base Canonicalization},
  author = {Wei Shen and Yang Yang and Yinan Liu},
  journal= {arXiv preprint arXiv:2206.11130},
  year   = {2022}
}

备注

Accepted by SIGKDD 2022