中文

哈萨姆文本写作异常的自动纠正

计算与语言 2026-05-05 v2

摘要

哈萨姆文本常以各种写作异常著称,包括字符错误替换和间距错误,这些错误有时会阻碍自然语言处理(NLP)应用程序的正常运行。本文提出了一种自动纠正异常的 method,通过对基于转换器的模型进行微调来实现。我们收集了来自多个公开来源的语料库,创建了一个规模超过 40 万对的大型平行数据集,通过引入合成生成的噪声来模拟真实的写作错误。此外,我们对多个多语言和非洲语言模型进行了微调,包括 M2M100、AfriTeVA、NCAIR1/N-ATLaS、UBC-NLP/cheetah-base 以及其他变体的 BART 和 T5 用于此纠正任务。我们的实验结果表明,诸如 M2M100 等模型能够实现最先进的效果,尽管其规模较小且预训练方式不同,纠正错误对提高下游任务如文本分类、机器翻译、问答和 LLM 提示等方面的影响显著。这项研究提供了 method、公开可用的数据集以及模型比较,从而改善了哈萨姆文本质量,推动了该语言的 NLP 能力,并为其他低资源语言提供了可迁移的见解。

关键词

引用

@article{arxiv.2506.03820,
  title  = {Automatic Correction of Writing Anomalies in Hausa Texts},
  author = {Ahmad Mustapha Wali and Sergiu Nisioi},
  journal= {arXiv preprint arXiv:2506.03820},
  year   = {2026}
}

备注

Accepted at ACL2026