中文

用于释义 plagiarism 识别的语义感知距离与相似度度量

计算与语言 2018-05-31 v1

摘要

释义 plagiarism 识别是一项非常复杂的任务,因为被抄袭文本会通过多种改写技术被有意修改。据此,本文提出两种用于评估给定两文本相关性的新度量:一种语义感知相似度度量与一种语义感知编辑距离。两种度量均能从外部资源或词的分布式表示中提取语义信息,从而为训练有监督分类器以检测释义 plagiarism 提供信息丰富的特征。所得结果表明,所提度量在检测不同类型释义 plagiarism 时始终表现良好。此外,结果与最先进(SOTA)方法极具竞争力,且优势在于其方案更为简单却同样有效。

关键词

引用

@article{arxiv.1805.11611,
  title  = {Semantically-informed distance and similarity measures for paraphrase plagiarism identification},
  author = {Miguel A. Álvarez-Carmona and Marc Franco-Salvador and Esaú Villatoro-Tello and Manuel Montes-y-Gómez and Paolo Rosso and Luis Villaseñor-Pineda},
  journal= {arXiv preprint arXiv:1805.11611},
  year   = {2018}
}