BABILong:测试大语言模型长上下文推理极限基准
计算与语言
2024-11-07 v2 人工智能
摘要
近年来,大语言模型(LLM)的输入上下文大小有显著增长。然而,现有的评估方法未能跟上,未能全面评估模型处理长上下文的效率。为弥合这一差距,我们引入BABILong基准测试,旨在测试语言模型在极长文档中跨事实推理的能力。BABILong包含20个推理任务,包括事实链、简单归纳、演绎、计数以及处理列表/集合。这些任务本身就具有挑战性,当所需事实分布在长篇自然文本中时,更加苛刻。我们的评估显示,流行的LLM仅能有效利用约10-20%的上下文,其性能随推理复杂度的增加而显著下降。在上下文推理的替代方法中,检索增强生成(RAG)方法在单事实问答中实现了约60%的准确率,独立于上下文长度。在上下文扩展方法中,循环记忆变压器经过微调后显示出最高性能,能够处理最长达5000万token的文本。BABILong基准测试可扩展至任意长度,以支持评估具有新能力的模型,我们提供的分割最高可达1000万token。
引用
@article{arxiv.2406.10149,
title = {BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack},
author = {Yuri Kuratov and Aydar Bulatov and Petr Anokhin and Ivan Rodkin and Dmitry Sorokin and Artyom Sorokin and Mikhail Burtsev},
journal= {arXiv preprint arXiv:2406.10149},
year = {2024}
}
备注
NeurIPS 2024 Datasets and Benchmarks Track