分析 LLM 在多轮指令跟随中的多语言能力:以阿拉伯语为例
计算与语言
2023-10-24 v1
摘要
尽管在各类任务上基准测试大语言模型(LLMs)已取得显著进展,但对于其在阿拉伯语等较少被测试语言下响应多轮指令的能力,仍缺乏全面评估。我们的论文详细考察了开放 LLM 在阿拉伯语此类场景中的熟练度。利用 MT-Bench 基准套件的定制阿拉伯语翻译,我们采用 GPT-4 作为英语与阿拉伯语查询的统一评估器,以评估并比较 LLM 在各种开放式任务上的表现。我们的发现揭示了模型在不同任务类别(例如逻辑与读写)上受英语或阿拉伯语指令时响应的差异。我们发现,使用多语言与多轮数据集微调的基础模型,可媲美从头于多语言数据训练的模型。最后,我们假设小型开放 LLM 的集成可在基准上具备与专有 LLM 竞争的实力。
引用
@article{arxiv.2310.14819,
title = {Analyzing Multilingual Competency of LLMs in Multi-Turn Instruction Following: A Case Study of Arabic},
author = {Sabri Boughorbel and Majd Hawasly},
journal= {arXiv preprint arXiv:2310.14819},
year = {2023}
}
备注
Accepted at SIGARAB ArabicNLP 2023