中文

基于语料的释义检测实验与综述

计算与语言 2021-06-02 v1 机器学习

摘要

释义检测对许多应用十分重要,包括剽窃检测、作者归属、问答、文本摘要、广义文本挖掘等。本文中,我们给出各类基于语料的模型(尤其是深度学习(DL)模型)在释义检测任务上的性能概览。我们报告了八个模型(LSI、TF-IDF、Word2Vec、Doc2Vec、GloVe、FastText、ELMO和USE)在三个不同公开可用语料上的评估结果:Microsoft Research Paraphrase Corpus、Clough and Stevenson以及Webis Crowd Paraphrase Corpus 2011。通过大量实验,我们确定了最合适的文本预处理方法:超参数、子模型选择(如存在,例如Skipgram与CBOW)、距离度量以及语义相似度/释义检测阈值。我们的发现及其他使用深度学习模型的研究人员的研究表明,DL模型与传统最先进方法极具竞争力,并具有应进一步开发的潜力。

关键词

引用

@article{arxiv.2106.00145,
  title  = {Corpus-Based Paraphrase Detection Experiments and Review},
  author = {Tedo Vrbanec and Ana Mestrovic},
  journal= {arXiv preprint arXiv:2106.00145},
  year   = {2021}
}

备注

25 pages, 7 figures, 4 tables