中文

使用 MultiQ 评估大型语言模型的基础多语言能力

计算与语言 2024-07-19 v2 人工智能

摘要

大型语言模型 (LLMs) 需要服务于所有人,包括全球大多数非英语使用者。然而,当今大多数 LLM,特别是开源 LLM,通常仅旨在用于英语(例如 Llama2、Mistral)或少量高资源语言(例如 Mixtral、Qwen)。最近的研究表明,尽管其预期用途有限,人们仍会用多种不同的语言提示 LLM。因此,在本文中,我们研究了最先进的开源 LLM 在其预期用途之外的基础多语言能力。为此,我们引入了 MultiQ,这是一个新的银标准基准,用于基础开放式问答,包含跨越 137 种类型学多样化语言的 2.74k 测试问题。利用 MultiQ,我们评估了语言忠实度(即模型是否用提示语言响应)和问答准确性。我们测试的所有 LLM 至少在部分超出其预期用途的语言上能够忠实且/或准确地响应。大多数模型在忠实响应时更准确。然而,模型之间的差异很大,并且存在一个长尾分布的语言,模型在这些语言上既不准确也不忠实。我们探讨了分词差异作为我们发现的潜在解释,并识别出值得进一步调查的可能相关性。

关键词

引用

@article{arxiv.2403.03814,
  title  = {Evaluating the Elementary Multilingual Capabilities of Large Language Models with MultiQ},
  author = {Carolin Holtermann and Paul Röttger and Timm Dill and Anne Lauscher},
  journal= {arXiv preprint arXiv:2403.03814},
  year   = {2024}
}