中文

数据增强何时有效?评估 Hausa 和 Fongbe 自然语言处理中的 LLM 与 Back-Translation 方法

计算与语言 2026-04-15 v1 人工智能

摘要

数据稀缺限制了针对低资源非洲语言的自然语言处理开发。我们评估了两种数据增强方法——LLM 生成式数据(Gemini 2.5 Flash)和回译(NLLB-200)——用于 Hausa 和 Fongbe,这两种西非语言在 LLM 生成质量上存在显著差异。我们使用 MasakhaNER 2.0 和 MasakhaPOS 基准对增强后的数据在命名实体识别(NER)和词性标注(POS)任务上的效果进行评估。我们的结果表明,增强效果取决于任务类型,而非语言或 LLM 质量。对于 NER,两种方法均未显著提升基线;LLM 生成式数据对 Hausa NER 降低 0.24% F1 分数,Fongbe NER 降低 1.81% F1。对于 POS 标注,LLM 生成式数据对 Fongbe 提升 0.33% 准确率,回译对 Hausa 提升 0.17%;回译对 Fongbe POS 降低 0.35%,对 Hausa POS 影响可忽略不计。相同生成的合成数据在 Fongbe 上在不同任务中产生相反效果——既损害 NER 又提升 POS——表明任务结构比合成数据质量更主导增强结果。这一发现挑战了 LLM 生成质量能预测增强效果的假设,提供了可操作的指导:数据增强应被视为特定任务的干预,而非普遍有益的预处理步骤。

关键词

引用

@article{arxiv.2604.12540,
  title  = {When Does Data Augmentation Help? Evaluating LLM and Back-Translation Methods for Hausa and Fongbe NLP},
  author = {Mahounan Pericles Adjovi and Roald Eiselen and Prasenjit Mitra},
  journal= {arXiv preprint arXiv:2604.12540},
  year   = {2026}
}

备注

13 pages, 6 tables; previously submitted to KDD 2026