中文

基于Spearman秩相关系数的文本数据相似性度量

机器学习 2019-11-27 v1 计算与语言 信息检索 机器学习

摘要

在过去十年中,从数据中提取信息的领域取得了许多不同的进展。最简单形式的信息提取发生在计算环境中,可通过一系列查询提取结构化数据。因此,数据量的持续扩张为从文本文档(TD)中进行知识提取(KE)提供了机会。此类典型问题是从一组TD中提取共同特征与知识,并可在称为聚类的过程将相似的TD分组。本文提出一种针对一组TD、基于其内容共同特征与语义的此类KE技术。我们的技术基于Spearman秩相关系数(SRCC),所进行的实验已证明其为一种实现高质量KE的综合性度量。

关键词

引用

@article{arxiv.1911.11750,
  title  = {A Measure of Similarity in Textual Data Using Spearman's Rank Correlation Coefficient},
  author = {Nino Arsov and Milan Dukovski and Blagoja Evkoski and Stefan Cvetkovski},
  journal= {arXiv preprint arXiv:1911.11750},
  year   = {2019}
}