中文

GPTAraEval:对 ChatGPT 在阿拉伯语 NLP 上的综合评估

计算与语言 2023-10-24 v2 机器学习

摘要

ChatGPT 的出现预示着 NLP 的变革阶段,其在许多英语基准上的优异表现尤为突出。然而,该模型在不同语言语境下的效能在很大程度上仍是未知领域。本工作旨在弥合这一知识鸿沟,主要聚焦于评估 ChatGPT 在阿拉伯语及其方言变体上的能力。我们的综合研究对 ChatGPT 进行了大规模自动化和人工评估,涵盖超过 60 个不同数据集上的 44 项不同的语言理解与生成任务。据我们所知,这标志着首次对 ChatGPT 在阿拉伯语 NLP 中部署的广泛性能分析。我们的发现表明,尽管 ChatGPT 在英语上表现卓越,但其在阿拉伯语上持续被经过阿拉伯语微调的较小模型超越。我们进一步细致比较了 ChatGPT 与 GPT-4 的现代标准阿拉伯语(MSA)和方言阿拉伯语(DA),揭示了两种模型在处理阿拉伯语方言相对于 MSA 时的相对不足。尽管我们进一步探索并确认了使用 GPT-4 作为人工评估潜在替代方案的效用,我们的工作增添了越来越多强调 ChatGPT 局限性的研究。

关键词

引用

@article{arxiv.2305.14976,
  title  = {GPTAraEval: A Comprehensive Evaluation of ChatGPT on Arabic NLP},
  author = {Md Tawkat Islam Khondaker and Abdul Waheed and El Moatez Billah Nagoudi and Muhammad Abdul-Mageed},
  journal= {arXiv preprint arXiv:2305.14976},
  year   = {2023}
}

备注

EMNLP 2023 Main Conference