利用来自斯瓦希里语的迁移学习:推进科摩罗方言的解决方案
计算与语言
2024-12-19 v1 人工智能
机器学习
摘要
如今,尽管像斯瓦希里语这样的部分非洲语言已拥有足够的资源来开发高性能的自然语言处理(NLP)系统,但该大陆上使用的许多其他语言仍缺乏此类支持。对于这些仍处于起步阶段的语言,存在多种可能性来解决这一严重的数据匮乏问题。其中之一是迁移学习,它允许低资源语言受益于与其相似的其他语言的良好表示。在本研究中,我们采用类似的方法,旨在为科摩罗语开创 NLP 技术,科摩罗语是属于班图语系的四种语言或方言之一。我们的方法最初受到以下假设的启发:如果人类可以毫不费力或只需很少努力就能理解与其母语不同的语言,那么在机器上对这一过程进行建模将完全可能。为实现这一目标,我们考虑构建混合斯瓦希里语的科摩罗语数据集的方法。这里需要注意的是,在斯瓦希里语数据方面,我们仅通过计算候选数据与源数据之间的词汇距离来关注与科摩罗语最接近的元素。我们在两个用例中实证检验了这一假设:自动语音识别(ASR)和机器翻译(MT)。我们的 MT 模型分别取得了 0.6826、0.42 和 0.6532 的 ROUGE-1、ROUGE-2 和 ROUGE-L 分数,而我们的 ASR 系统记录了 39.50\% 的 WER 和 13.76\% 的 CER。这项研究对于推进代表性不足语言的 NLP 至关重要,并具有在数字时代保护和促进科摩罗语言遗产的潜力。
引用
@article{arxiv.2412.12143,
title = {Harnessing Transfer Learning from Swahili: Advancing Solutions for Comorian Dialects},
author = {Naira Abdou Mohamed and Zakarya Erraji and Abdessalam Bahafid and Imade Benelallam},
journal= {arXiv preprint arXiv:2412.12143},
year = {2024}
}
备注
This paper was presented at the 6th Deep Learning Indaba Conference (DLI 2024)