基于词嵌入的编辑距离
计算与语言
2018-10-26 v1
摘要
文本相似度计算是自然语言处理及相关领域的基础问题。近年来,深度神经网络被用于执行该任务并取得了高性能。神经网络通常在监督学习中使用标注数据训练,而标注数据的创建成本通常很高。在这篇短文中,我们关注文本相似度计算的无监督学习。我们提出一种称为基于词嵌入的编辑距离(WED)的新方法,将词嵌入引入编辑距离。在三个基准数据集上的实验表明,WED 优于包括编辑距离、基于 TF-IDF 的余弦、基于词嵌入的余弦、Jaccard 指数等最先进的(SOTA)无监督方法。
引用
@article{arxiv.1810.10752,
title = {Word Embedding based Edit Distance},
author = {Yilin Niu and Chao Qiao and Hang Li and Minlie Huang},
journal= {arXiv preprint arXiv:1810.10752},
year = {2018}
}