利用跨语言特征改进低资源语言的同源词检测
计算与语言
2021-12-17 v1
摘要
同源词是跨语言同一词形的变体;例如西班牙语中的“fonema”与英语中的“phoneme”是同源词,二者均意为“一个声音单位”。任意两种语言间同源词的自动检测任务可助力跨语言信息检索、计算系统发育学和机器翻译等下游NLP任务。本文中,我们展示了利用跨语言词嵌入检测十四种印度语言间同源词的方法。我们的方法引入知识图谱的上下文以生成改进的同源词检测特征表示。随后,我们评估了作为下游任务的同源词检测机制对神经机器翻译(NMT)的影响。我们在包含十二种印度语言(即梵语、印地语、阿萨姆语、奥里亚语、卡纳达语、古吉拉特语、泰米尔语、泰卢固语、旁遮普语、孟加拉语、马拉地语和马拉雅拉姆语)的具有挑战性的数据集上评估了检测同源词的方法。此外,我们为另外两种印度语言孔卡尼语和尼泊尔语构建了评估数据集。我们观察到同源词检测的F值最高提升18个百分点。进而,我们观察到使用我们的方法提取的同源词可将NMT质量最高提升2.76 BLEU。我们还公开发布了我们的代码、新构建的数据集和跨语言模型。
引用
@article{arxiv.2112.08789,
title = {Harnessing Cross-lingual Features to Improve Cognate Detection for Low-resource Languages},
author = {Diptesh Kanojia and Raj Dabre and Shubham Dewangan and Pushpak Bhattacharyya and Gholamreza Haffari and Malhar Kulkarni},
journal= {arXiv preprint arXiv:2112.08789},
year = {2021}
}
备注
Published at COLING 2020