中文

利用紧密亲缘语言形态知识的低资源语言弱监督深度同源词检测框架

计算与语言 2023-11-10 v1 人工智能

摘要

在低资源语言中利用同源词进行迁移学习,是无监督机器翻译、命名实体识别与信息检索等语言理解任务的一个令人振奋的机遇。以往方法主要聚焦于基于正字法、语音或最先进上下文语言模型的监督同源词检测任务,对大多数低资源语言表现不佳。本文提出一种新颖的、与语言无关的弱监督深度同源词检测框架,利用紧密亲缘语言的形态知识服务于低资源语言。我们训练一个编码器以获取语言的形态知识,并将该知识迁移以在有无枢轴语言的情况下,为紧密亲缘语言执行无监督与弱监督同源词检测任务。在无监督情形下,它克服了对同源词人工标注的需求。我们在跨语系的多个已发布同源词检测数据集上实验,观察到不仅相较最先进(SOTA)方法有显著提升,而且我们的方法优于最先进的监督与无监督方法。我们的模型可扩展至任意语系的广泛语言,因其克服了训练所需同源词对标注的要求。代码与数据集构建脚本可在 https://github.com/koustavagoswami/Weakly_supervised-Cognate_Detection 找到。

关键词

引用

@article{arxiv.2311.05155,
  title  = {Weakly-supervised Deep Cognate Detection Framework for Low-Resourced Languages Using Morphological Knowledge of Closely-Related Languages},
  author = {Koustava Goswami and Priya Rani and Theodorus Fransen and John P. McCrae},
  journal= {arXiv preprint arXiv:2311.05155},
  year   = {2023}
}

备注

Accepted at EMNLP 2023 conference