中文

针对阿尔及尔社交媒体文本的词级形态感知语言模型 chDzDT

计算与语言 2025-09-03 v1 人工智能

摘要

预训练语言模型(PLMs)在自然语言处理领域取得了显著进展,提供了上下文敏感的文本表示。然而,阿尔及尔方言代表性不足,缺乏专门模型。加工这一方言具有挑战性,由于其复杂的形态结构、频繁的代码切换、多种脚本以及强烈的词汇来自其他语言的影响。这些特征使标记化和传统词级或子词级方法的效果大幅下降。为此,我们提出chDzDT,这是一个针对阿尔及尔形态结构设计的字符级预训练语言模型。与依赖标记序列的常规PLMs不同,chDzDT在独立单词上进行训练。这种设计使模型能够在不依赖标记边界或标准正字法的情况下,对形态模式进行稳健编码。训练语料来源于多样化来源,包括YouTube评论、法语、英语和阿尔及尔语土坯项目的维基百科,涵盖多种脚本和语言变体,形成大规模预训练工作。我们的贡献有三个:(i)对阿尔及尔方言进行详细的形态分析;(ii)构建阿尔及尔多语言词典数据集;(iii)开发和广泛评估了一个面向下游任务的字符级PLM,作为面向形态的编码器。该方法展示了字符级建模处理形态丰富、资源有限方言的潜力,为构建更具包容性和可适应性的NLP系统奠定了基础。

关键词

引用

@article{arxiv.2509.01772,
  title  = {chDzDT: Word-level morphology-aware language model for Algerian social media text},
  author = {Abdelkrime Aries},
  journal= {arXiv preprint arXiv:2509.01772},
  year   = {2025}
}