一种参数化相似性方法:基于语义标注大型数据集的比较实验
人工智能
2023-02-09 v1
摘要
我们提出了一种旨在度量数字资源语义相似性的参数化方法 SemSimp。SemSimp 基于信息量的概念,并利用参考本体与分类推理,涵盖了为本体概念赋予权重的多种方法。具体而言,权重可通过考虑可用的数字资源或给定领域的参考本体结构来计算。我们通过统计分析与专家评判评估,将 SemSimp 与文献中提出的六种具有代表性的用于比较概念集合的语义相似性方法进行了对比实验。为实现可靠评估,我们使用了基于美国计算机协会(ACM)数字图书馆的真实世界大型数据集,以及源自 ACM 计算分类系统(ACM-CCS)的参考本体。对每种方法,我们考虑了两个指标。第一个涉及识别选自 ACM Transactions on Information Systems 期刊若干特刊中论文间相似性的置信度,第二个涉及与人类判断的 Pearson 相关性。结果表明,SemSimp 的某一种配置优于其他被评估的方法。在物理学领域进行的附加实验表明,一般而言,SemSimp 提供的效果优于其他相似性方法。
引用
@article{arxiv.2302.04123,
title = {A Parametric Similarity Method: Comparative Experiments based on Semantically Annotated Large Datasets},
author = {Antonio De Nicola and Anna Formica and Michele Missikoff and Elaheh Pourabbas and Francesco Taglino},
journal= {arXiv preprint arXiv:2302.04123},
year = {2023}
}
备注
32 pages, 9 figures, 11 tables