挑战阿拉伯语中依赖语言的词分割:在机器翻译与词性标注中的应用
计算与语言
2017-09-05 v1
摘要
词分割在改进任何阿拉伯语自然语言处理应用中起着关键作用。因此,大量研究致力于提高其准确性。然而,现成工具存在以下缺点:i) 使用复杂;ii) 依赖领域/方言。我们探索了三种与语言无关的形态分割替代方案,分别使用:i) 数据驱动的子词单元,ii) 字符作为学习单元,以及 iii) 利用字符卷积神经网络(CNN)学习的词嵌入。在机器翻译和词性标注(POS)任务上,我们发现这些方法达到了接近、偶尔超越最先进(state-of-the-art)性能的表现。在我们的分析中,表明神经机器翻译系统对源语言与目标语言词符比例敏感,且比例接近或等于或大于1时给出最优性能。
引用
@article{arxiv.1709.00616,
title = {Challenging Language-Dependent Segmentation for Arabic: An Application to Machine Translation and Part-of-Speech Tagging},
author = {Hassan Sajjad and Fahim Dalvi and Nadir Durrani and Ahmed Abdelali and Yonatan Belinkov and Stephan Vogel},
journal= {arXiv preprint arXiv:1709.00616},
year = {2017}
}
备注
ACL 2017 pages 7