利用方言识别在自动方言文本规范化中的应用
计算与语言
2025-06-02 v1
摘要
方言阿拉伯语是阿拉伯语母语者在日常交流中使用的主要口语语言。社交媒体平台的兴起显著扩大了其作为书面语言的使用。然而,方言阿拉伯语 lacks 标准正字法,结合社交媒体中用户生成内容的内在噪声,给处理方言阿拉伯语的自然语言处理应用带来了重大挑战。本文探讨并报告了CODAfication任务,这一任务旨在将方言阿拉伯语规范化为方言阿拉伯语常规正字法(CODA)。我们使用包含多个阿拉伯方言的独特平行语料库,聚焦五大城市方言。我们对新开发的序列到序列模型在CODAfication任务上进行基准测试。进一步我们表明,利用方言识别信息可在所有方言上提升性能。我们将代码、数据和预训练模型公开于公开场所。
引用
@article{arxiv.2407.03020,
title = {Exploiting Dialect Identification in Automatic Dialectal Text Normalization},
author = {Bashar Alhafni and Sarah Al-Towaity and Ziyad Fawzy and Fatema Nassar and Fadhl Eryani and Houda Bouamor and Nizar Habash},
journal= {arXiv preprint arXiv:2407.03020},
year = {2025}
}
备注
Accepted to ArabicNLP 2024, ACL