中文

六种语言噪声字幕上的复述检测

计算与语言 2018-09-24 v1

摘要

我们在包含六种欧洲语言(德语、英语、芬兰语、法语、俄语和瑞典语)的 Opusparcus 语料库字幕数据上执行自动复述检测。我们训练了两类有监督句子嵌入模型:词平均(WA)模型与门控循环平均网络(GRAN)模型。我们发现 GRAN 优于 WA,且对噪声训练数据更具鲁棒性。使用更多且更噪声的数据比较少且更干净的数据获得了更好的结果。此外,我们在其他数据集上进行了实验,由于训练与测试数据之间的领域不匹配,未能达到同等性能水平。

关键词

引用

@article{arxiv.1809.07978,
  title  = {Paraphrase Detection on Noisy Subtitles in Six Languages},
  author = {Eetu Sjöblom and Mathias Creutz and Mikko Aulamo},
  journal= {arXiv preprint arXiv:1809.07978},
  year   = {2018}
}

备注

To appear in Proceedings of W-NUT at EMNLP 2018, Brussels, Belgium, 1 November 2018