中文

多语言长上下文中的"针在草堆中":多语言大语言模型的长上下文行为研究

计算与语言 2024-08-20 v1 机器学习

摘要

尽管近期大语言模型(LLMs)在响应多语言查询方面展现出显著能力,但它们处理长多语言上下文的能力尚未被探索。因此,系统评估LLMs在多语言设置下的长上下文能力至关重要,特别是在信息检索的背景下。为填补这一空白,我们提出了多语言"针在草堆中"(MLNeedle)测试,用于评估模型从多语言干扰文本集合(草堆)中检索相关信息(针)的能力。该测试作为多语言问答任务的扩展,涵盖了单语和跨语言检索。我们在MLNeedle上评估了四种最先进LLMs。研究结果表明,模型性能随语言和针的位置不同而显著变化。具体而言,我们观察到当针(i)位于英语语系之外的语种中,以及(ii)位于输入上下文中间时,模型性能最低。此外,尽管某些模型声称上下文大小为8k8k个标记或更大,但随着上下文长度增加,没有模型展现出令人满意的跨语言检索性能。我们的分析为多语言设置下LLMs的长上下文行为提供了关键见解,以指导未来的评估协议。据我们所知,这是首个研究LLMs多语言长上下文行为的研究。

关键词

引用

@article{arxiv.2408.10151,
  title  = {Multilingual Needle in a Haystack: Investigating Long-Context Behavior of Multilingual Large Language Models},
  author = {Amey Hengle and Prasoon Bajpai and Soham Dan and Tanmoy Chakraborty},
  journal= {arXiv preprint arXiv:2408.10151},
  year   = {2024}
}