Taqyim:使用 ChatGPT 模型评估阿拉伯语 NLP 任务
计算与语言
2023-06-29 v1
摘要
大语言模型(LLMs)在无需微调的情况下于各类下游任务上展现出令人印象深刻的性能,包括构建于 GPT-3.5 与 GPT-4 等 LLM 之上的基于聊天的模型 ChatGPT。尽管相较于英语训练占比更低,这些模型在其他语言上也表现出显著能力。本研究中,我们评估了 GPT-3.5 与 GPT-4 模型在七项不同阿拉伯语 NLP 任务上的表现:情感分析、翻译、音译、复述、词性标注、摘要与注音。我们的发现显示,GPT-4 在七项任务中的五项上优于 GPT-3.5。此外,我们对情感分析任务进行了深入分析,阐释 LLM 如何在具挑战性的方言数据集上取得优异结果。我们还引入了新的 Python 接口 https://github.com/ARBML/Taqyim,可轻松实现这些任务的评估。
引用
@article{arxiv.2306.16322,
title = {Taqyim: Evaluating Arabic NLP Tasks Using ChatGPT Models},
author = {Zaid Alyafeai and Maged S. Alshaibani and Badr AlKhamissi and Hamzah Luqman and Ebrahim Alareqi and Ali Fadel},
journal= {arXiv preprint arXiv:2306.16322},
year = {2023}
}