评估多语言长上下文模型于检索与推理
计算与语言
2024-10-15 v3
摘要
近期大型语言模型 (LLM) 在处理长上下文方面展现出惊人的能力,一些模型在合成检索任务中几乎完美地实现召回。然而,这些评估主要聚焦于英文文本且仅涉及单个目标句子于冗长上下文中。我们的工作调查 LLM 性能如何在多语言环境中推广,尤其关注包含多个隐藏目标句子的情形。我们创建了一个新数据集 -- mLongRR -- 全面评估几个多语言长上下文 LLM 在检索与推理任务中跨越五种语言的表现: 英文、越南语、印尼语、斯瓠希利语与索马利语。这些语言共享拉丁字母脚本,但属于不同的语言家族且资源水平各异。我们的分析揭示了语言之间存在显著的性能差距。最佳表现的模型如 Gemini-1.5 与 GPT-4o,在英文中实现约96%的准确率,而在索马利语中仅达到约36%(单个目标句子)。当处理三个目标句子时,英文准确率下降至40%,索马利语降至0%。我们的发现凸显了长上下文 LLM 在处理更长的上下文、目标句子数量增加或低资源语言方面所面临的挑战。
关键词
引用
@article{arxiv.2409.18006,
title = {Evaluating Multilingual Long-Context Models for Retrieval and Reasoning},
author = {Ameeta Agrawal and Andy Dang and Sina Bagheri Nezhad and Rhitabrat Pokharel and Russell Scheinberg},
journal= {arXiv preprint arXiv:2409.18006},
year = {2024}
}
备注
To appear at MRL 2024