从 N-gram 到预训练多语言模型:语言识别
计算与语言
2024-10-14 v1 人工智能
摘要
本文探讨了 N-gram 模型和大型预训练多语言模型用于跨 11 种南非语言的语言识别(LID)。对于 N-gram 模型,本研究表明有效的数据大小选择对于建立目标语言的有效频率分布至关重要,这些模型能够有效地建模每种语言,从而提高语言排序。对于预训练多语言模型,我们进行了广泛的实验,涵盖多种大规模预训练多语言(PLM)模型——mBERT、RemBERT、XLM-r 以及非洲中心多语言模型——AfriBERTa、Afro-XLMr、AfroLM 和 Serengeti。我们进一步将这些模型与可用的大规模语言识别工具进行比较:Compact Language Detector v3(CLD V3)、AfroLID、GlotLID 和 OpenLID,以突出关注基于 LID 的重要性。从这些结果看,Serengeti 在 N-gram 到 Transformer 模型方面平均表现最佳。此外,我们提出了一个基于轻量级 BERT 的 LID 模型(za_BERT_lid),使用 NHCLT + Vukzenzele 语料库训练,性能与我们最佳的非洲中心模型相当。
引用
@article{arxiv.2410.08728,
title = {From N-grams to Pre-trained Multilingual Models For Language Identification},
author = {Thapelo Sindane and Vukosi Marivate},
journal= {arXiv preprint arXiv:2410.08728},
year = {2024}
}
备注
The paper has been accepted at The 4th International Conference on Natural Language Processing for Digital Humanities (NLP4DH 2024)