BAMBOO:评估大语言模型长文本建模能力的综合基准
计算与语言
2024-03-20 v3
摘要
大语言模型(LLMs)在常规长度的 NLP 任务上已展现出卓越的能力。近来,多项研究致力于扩展上下文长度并增强 LLM 的长文本建模能力。为全面评估 LLM 的长上下文能力,我们提出了 BAMBOO,一个多任务长上下文基准。BAMBOO 的设计遵循四项原则:综合能力评估、避免数据污染、精准自动评估,以及不同长度层级。它包含来自 5 类不同长文本理解任务的 10 个数据集,即问答、幻觉检测、文本排序、语言建模与代码补全,以覆盖 LLM 的核心能力与各领域。我们在 BAMBOO 上以五个长上下文模型开展实验,并进一步探讨关于长文本的四个关键研究问题。我们还定性分析了当前长上下文模型,并指出增强长文本建模能力的未来方向。我们在 https://github.com/RUCAIBox/BAMBOO 发布了数据、提示词与代码。
引用
@article{arxiv.2309.13345,
title = {BAMBOO: A Comprehensive Benchmark for Evaluating Long Text Modeling Capacities of Large Language Models},
author = {Zican Dong and Tianyi Tang and Junyi Li and Wayne Xin Zhao and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2309.13345},
year = {2024}
}
备注
Accepted for the Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING) 2024