用于计算语义相似度的分类法与神经嵌入方法的评估
计算与语言
2022-10-03 v1 人工智能
摘要
建模语义相似度在词汇语义应用中起着基础作用。计算语义相似度的一种自然方式是访问手工构建的语义网络,但相似度预测也可在分布向量空间中预期。即便有深度神经语言模型的最新突破,相似度计算仍是一项具有挑战性的任务。我们首先考察了测量分类法相似度的流行方法,包括仅利用分类法中语义关系的边数计数,以及估计概念特异度的复杂方法。我们进一步在建模分类法相似度中推导出三个加权因子。为研究分类法与分布式相似度度量之间的不同机制,我们从词频、多义程度和相似度强度角度,将每种度量与人工相似度判断进行头对头比较。我们的发现表明,在不微调均匀距离的情况下,分类法相似度度量可依赖最短路径长度作为预测语义相似度的主要因素;与分布式语义相反,边数计数不受使用中的义项分布偏置影响,且可字面及隐喻地度量词相似度;在相似度预测中将神经嵌入与概念关系进行改造的协同可能指示出在迁移学习上利用知识库的新趋势。看来在计算不同词频范围、多义程度和相似度强度下的语义相似度方面仍存在巨大差距。
引用
@article{arxiv.2209.15197,
title = {Evaluation of taxonomic and neural embedding methods for calculating semantic similarity},
author = {Dongqiang Yang and Yanqin Yin},
journal= {arXiv preprint arXiv:2209.15197},
year = {2022}
}