校正四种非洲语言的 FLORES 评估数据集
计算与语言
2024-10-08 v2
摘要
本文描述了针对四种非洲语言,即豪萨语、北索托语(塞佩蒂语)、聪加语和祖鲁语,对 FLORES 评估(dev 和 devtest)数据集所做的修正。原始数据集虽然在对低资源语言的覆盖方面具有开创性,但在所审查的语言中表现出各种不一致和不准确之处,这可能会损害自然语言处理(NLP)下游任务评估的完整性,尤其是机器翻译。通过母语者细致的审查过程,我们识别并实施了若干修正,提高了数据集的整体质量和可靠性。对于每种语言,我们提供了所遇到和已修正错误的简明总结,并展示了一些衡量现有数据集与修正后数据集之间差异的统计分析。我们相信,我们的修正提高了数据的语言准确性和可靠性,从而有助于更有效地评估涉及这四种非洲语言的 NLP 任务。最后,我们建议未来的翻译工作,特别是在低资源语言中,应优先考虑母语者在过程每个阶段的积极参与,以确保语言准确性和文化相关性。
引用
@article{arxiv.2409.00626,
title = {Correcting FLORES Evaluation Dataset for Four African Languages},
author = {Idris Abdulmumin and Sthembiso Mkhwanazi and Mahlatse S. Mbooi and Shamsuddeen Hassan Muhammad and Ibrahim Said Ahmad and Neo Putini and Miehleketo Mathebula and Matimba Shingange and Tajuddeen Gwadabe and Vukosi Marivate},
journal= {arXiv preprint arXiv:2409.00626},
year = {2024}
}