AraReasoner:评估面向阿拉伯语自然语言处理的基于推理的大语言模型
计算与语言
2025-12-16 v4
摘要
大语言模型(LLMs)在推理能力和通用自然语言处理(NLP)任务上已取得显著进展,但它们在阿拉伯语数据上的表现仍未被充分探索——阿拉伯语数据具有丰富的形态、多样化的方言和复杂的书写系统。本文对多个面向推理的大语言模型进行了全面的基准测试研究,特别关注新引入的DeepSeek模型,涵盖十五项阿拉伯语NLP任务。我们采用了零样本、少样本和微调等多种策略。这使我们能够系统地评估覆盖一系列应用的数据集上的性能,考察它们在不同复杂度下的语言推理能力。我们的实验揭示了若干关键发现。第一,精心选择仅三个上下文示例即可在分类任务上带来平均超过13个F1点的提升——将情感分析从35.3%提升到87.5%,将释义检测从56.1%提升到87.0%。第二,面向推理的DeepSeek架构在零样本设置下,在复杂推理任务上比强大的GPT o4-mini基线平均高出12个F1点。第三,基于LoRA的微调相比同等规模的模型扩展,额外带来了高达8个F1和BLEU点的提升。代码可在 https://github.com/gufranSabri/deepseek-evals 获取。
引用
@article{arxiv.2506.08768,
title = {AraReasoner: Evaluating Reasoning-Based LLMs for Arabic NLP},
author = {Ahmed Hasanaath and Aisha Alansari and Ahmed Ashraf and Chafik Salmane and Hamzah Luqman and Saad Ezzini},
journal= {arXiv preprint arXiv:2506.08768},
year = {2025}
}