Ada-LEval:使用长度自适应基准评估长上下文大语言模型
计算与语言
2024-04-11 v2 人工智能
摘要
最近,大语言模型(LLM)社区对增强LLM处理极长文档的能力越来越感兴趣。随着各种长文本技术和模型架构的出现,对模型长文本能力的精确和详细评估变得越来越重要。现有的长文本评估基准,如L-Eval和LongBench,基于开源数据集构建长文本测试集,主要关注问答和摘要任务。这些数据集包含不同长度(从2k到32k+)的测试样本混杂在一起,使得评估模型在不同长度范围内的能力变得困难。此外,它们没有覆盖最新LLM声称达到的超长设置(100k+ tokens)。在本文中,我们介绍了Ada-LEval,一个用于评估LLM长上下文理解能力的长度自适应基准。Ada-LEval包含两个具有挑战性的子集,TSort和BestAnswer,能够更可靠地评估LLM的长上下文能力。这些基准支持对测试用例长度的复杂操作,并且可以轻松生成高达128k tokens的文本样本。我们使用Ada-LEval评估了4个最先进的闭源API模型和6个开源模型。评估结果显示了当前LLM的局限性,特别是在超长上下文设置中。我们的代码可在https://github.com/open-compass/Ada-LEval获取。
引用
@article{arxiv.2404.06480,
title = {Ada-LEval: Evaluating long-context LLMs with length-adaptable benchmarks},
author = {Chonghua Wang and Haodong Duan and Songyang Zhang and Dahua Lin and Kai Chen},
journal= {arXiv preprint arXiv:2404.06480},
year = {2024}
}
备注
NAACL 2024