基于自适应进化聚类算法星从语料库推导概念层次结构中的形式背景约简
人工智能
2021-07-13 v1 计算与语言
摘要
由于人工构建概念层次结构通常是一个耗时且耗费资源的过程,因此将语料库中概念层次结构的推导过程自动化是有益的。由此,从语料库学习概念层次结构的整体过程包含一系列步骤:将文本解析为句子,拆分句子并随后进行分词。在词形还原步骤之后,使用形式概念分析(FCA)提取配对。然而,形式背景中可能存在一些无趣且错误的配对。生成形式背景可能导致耗时的过程,因此需要约简形式背景大小以去除无趣和错误的配对,从而相应地减少提取概念格与概念层次结构的时间。在此前提下,本研究旨在提出两个框架:(1)一个利用FCA审视当前从语料库推导概念层次结构过程的框架;(2)一个使用自适应版本ECA*降低第一个框架形式背景歧义性的框架。通过在两个框架上应用来自维基百科的385个样本语料库进行实验,以检验形式背景的约简大小,进而生成概念格与概念层次结构。所得形式背景的格使用概念格不变量与标准格进行评估。相应地,两个格之间的同态保留了所得概念层次结构的质量达89%(相对于基础层次结构),且约简后的概念格继承了标准格的结构关系。自适应ECA*针对其四种对应基线算法进行测试,以在不同密度(填充比)的随机数据集上衡量执行时间。结果表明,在不同填充比下,自适应ECA*比其他提及的竞争技术更快地执行概念格计算。
引用
@article{arxiv.2107.04781,
title = {Formal context reduction in deriving concept hierarchies from corpora using adaptive evolutionary clustering algorithm star},
author = {Bryar A. Hassan and Tarik A. Rashid and Seyedali Mirjalili},
journal= {arXiv preprint arXiv:2107.04781},
year = {2021}
}
备注
Complex Intell. Syst. (2021)