中文

基于字符的语言模型能否在低资源与噪声语言场景下提升下游任务性能?

计算与语言 2025-06-04 v2 机器学习

摘要

近期 NLP 的显著进展(主要基于上下文神经语言模型的成功)大多仅在至多几十种高资源语言上得到证明。为非标准化且低资源的语言构建语言模型以及更一般地 NLP 系统仍是一项挑战。在本工作中,我们关注使用拉丁字母扩展书写的北非口语方言阿拉伯语(称为 NArabizi),其多见于社交媒体与即时通讯。在这种显示高度可变性的低资源场景下,我们将基于字符的语言模型在词性标注和依存句法分析上的下游性能与单语及多语模型进行比较。我们表明,仅在 99k 句 NArabizi 上训练并在该语言小规模树库上微调的基于字符的模型,所取得的性能接近于用大型多语与单语模型预训练的相同架构。在更大的噪声法语用户生成内容数据集上确认这些结果后,我们认为此类基于字符的语言模型可成为低资源与高语言可变性设定下 NLP 的一种利器。

关键词

引用

@article{arxiv.2110.13658,
  title  = {Can Character-based Language Models Improve Downstream Task Performance in Low-Resource and Noisy Language Scenarios?},
  author = {Arij Riabi and Benoît Sagot and Djamé Seddah},
  journal= {arXiv preprint arXiv:2110.13658},
  year   = {2025}
}

备注

updated version with new results