中文

建模正字法变体提升尼日利亚皮钞语 NLP 性能

计算与语言 2024-04-30 v1 人工智能

摘要

尼日利亚皮钞语是源自英语的接触语言,传统上为口语语言,约有 1 亿人使用。尚未确立正字法标准,因此现有的少数皮钞语数据集因正字法变体(如拼写不一致)而充满噪声。这导致关键 NLP 任务中的模型性能不足。本文首次描述尼日利亚皮钞语文本中常见的各种正字法变体,并建模这些变体。数据集中识别出的变体构成了基于语音理论的词语编辑框架,用于生成正字法变体以增强训练数据。我们测试了这种数据增强对两项关键 NLP 任务的影响:机器翻译和情感分析。该变体生成框架以新正字法变体增强训练数据,这些变体在测试集中相关但原本未出现在训练集中。我们的结果表明,通过将来自其他语料库的真实文本与合成正字法变体相结合进行数据增强,可显著提升性能:情感分析提升 2.1 分,翻译到英文的 BLEU 分数提升 1.4 分。

关键词

引用

@article{arxiv.2404.18264,
  title  = {Modeling Orthographic Variation Improves NLP Performance for Nigerian Pidgin},
  author = {Pin-Jie Lin and Merel Scholman and Muhammed Saeed and Vera Demberg},
  journal= {arXiv preprint arXiv:2404.18264},
  year   = {2024}
}

备注

Accepted to LREC-COLING 2024 Main Conference