相似度估计中 APSyn 与向量余弦的对比测试
计算与语言
2016-10-06 v2
摘要
在分布语义模型(DSMs)中,向量余弦(Vector Cosine)被广泛用于估计词向量间的相似度,尽管该度量已被注意到存在若干缺陷。近期文献提出了其他试图缓解此类偏差的方法。本文旨在研究 APSyn,这是一种计算两个目标词的最相关上下文之间交集程度、并以上下文相关性加权的度量。我们在多个流行测试集上的相似度估计任务中评估了该度量,结果表明 APSyn 实际上极具竞争力,即便与文献中针对词嵌入(word embeddings)所报告的结果相比亦然。此外,APSyn 解决了向量余弦的一些弱点,在真实的相似度估计上也表现良好。
引用
@article{arxiv.1608.07738,
title = {Testing APSyn against Vector Cosine on Similarity Estimation},
author = {Enrico Santus and Emmanuele Chersoni and Alessandro Lenci and Chu-Ren Huang and Philippe Blache},
journal= {arXiv preprint arXiv:1608.07738},
year = {2016}
}
备注
8 pages, 1 figure, 4 tables, PACLIC, cosine, vectors, DSMs