中文

使用 seq2(seq)^2 的梵语 Sandhi 拆分

计算与语言 2019-07-16 v4

摘要

在梵语中,小词(语素)通过称为 Sandhi 的过程组合成复合词。Sandhi 拆分是将给定复合词拆分为其组成语素的过程。尽管语言中存在支配词语拆分的规则,但识别复合词中拆分位置极具挑战性。虽然现有的 Sandhi 拆分系统纳入了这些预定义拆分规则,但由于同一复合词可能以多种方式分解以提供句法正确的拆分,它们准确率较低。在本研究中,我们提出一种称为双解码器 RNN(DD-RNN)的新型深度学习架构,其(i)以 95% 的准确率预测拆分位置,(ii)以 79.5% 的准确率预测组成词(学习 Sandhi 拆分规则),优于当前最优(state-of-art)20%。此外,我们通过在中文分词问题上展示具竞争力的结果,表明了深度学习模型的泛化能力。

关键词

引用

@article{arxiv.1801.00428,
  title  = {Sanskrit Sandhi Splitting using seq2(seq)^2},
  author = {Rahul Aralikatte and Neelamadhav Gantayat and Naveen Panwar and Anush Sankaran and Senthil Mani},
  journal= {arXiv preprint arXiv:1801.00428},
  year   = {2019}
}

备注

Accepted in EMNLP 2018