中文

ARPA:亚美尼亚语复述检测语料库与模型

计算与语言 2020-09-29 v1

摘要

在这项工作中,我们采用基于回译的半自动方法为亚美尼亚语生成句子级复述语料库。初始句子集合从亚美尼亚语译为英语并回译两次,从而产生词汇距离远但语义相似的句子对。生成的复述随后经过人工审阅与标注。利用该方法创建训练和测试数据集,共包含 2360 条复述。此外,这些数据集被用于训练和评估基于 BERT 的亚美尼亚语复述检测模型,取得了与其他语言最先进(state-of-the-art)水平相当的结果。

关键词

引用

@article{arxiv.2009.12615,
  title  = {ARPA: Armenian Paraphrase Detection Corpus and Models},
  author = {Arthur Malajyan and Karen Avetisyan and Tsolak Ghukasyan},
  journal= {arXiv preprint arXiv:2009.12615},
  year   = {2020}
}

备注

To be published in the proceedings of Ivannikov Memorial Workshop 2020