中文

应对规范切分的低资源挑战

计算与语言 2020-10-07 v1 人工智能 机器学习

摘要

规范形态切分是指将词划分为其标准化的语素。此处我们关注训练数据有限时该任务的方法。我们将高资源语言德语、英语和印尼语在模拟低资源设定下的模型性能,与在真正低资源语言 Popoluca 和 Tepehua 新数据集上的实验进行比较。我们探索了该任务的两个新模型,借鉴密切相关的形态生成领域:一种 LSTM 指针生成器,以及一种以模仿学习训练的具有硬单调注意力的序列到序列模型。我们发现,在低资源设定下,这些新方法在所有语言上以最高 11.4% 的准确率优于现有方法。然而,尽管模拟低资源场景的准确率对所有语言均超过 50%,但对于真正低资源语言 Popoluca 和 Tepehua,我们的最佳模型分别仅取得 37.4% 和 28.4% 的准确率。因此我们得出结论:规范切分对低资源语言仍是一项具有挑战性的任务。

关键词

引用

@article{arxiv.2010.02804,
  title  = {Tackling the Low-resource Challenge for Canonical Segmentation},
  author = {Manuel Mager and Özlem Çetinoğlu and Katharina Kann},
  journal= {arXiv preprint arXiv:2010.02804},
  year   = {2020}
}

备注

Accepted to EMNLP 2020