马来亚拉姆语和泰卢固语原生词与借词的无监督分离
计算与语言
2020-05-07 v1 信息检索
摘要
通常,一种语言的词汇会在未经翻译的情况下被另一种语言采用;这些词以后者的文字以转写形式出现。这种现象在印度语言中尤为普遍,其中许多词借自英语。在本文中,我们针对从黏着型达罗毗荼语言的大规模词数据集自动且无监督地识别借词的任务。我们瞄准达罗毗荼语系中的两种具体语言,即马来亚拉姆语和泰卢固语。基于对这两种语言的熟悉,我们提出一个观察:这两种语言中的原生词往往比借自其他语言的词具有更加多变的词干——词干是表示由词的前几个字符构成的子词序列的简写。我们利用这一观察构建目标函数及其迭代优化形式以进行优化,在此过程中得到每个词原生程度的评分。通过对来自马来亚拉姆语和泰卢固语的真实世界数据集的广泛实证分析,我们展示了我们的方法在量化原生程度方面相对于该任务现有基线的有效性。
引用
@article{arxiv.2002.05527,
title = {Unsupervised Separation of Native and Loanwords for Malayalam and Telugu},
author = {Sridhama Prakhya and Deepak P},
journal= {arXiv preprint arXiv:2002.05527},
year = {2020}
}
备注
submitted to Natural Language Engineering; 22 pages; 4 figures. This is an extended version of a conference paper (arXiv:1803.09641) that has been enriched with substantive new content, with significant extensions on both the method modeling and the experiments