中文

BAMBOO:评估大语言模型长文本建模能力的综合基准

计算与语言 2024-03-20 v3

摘要

大语言模型(LLMs)在常规长度的 NLP 任务上已展现出卓越的能力。近来,多项研究致力于扩展上下文长度并增强 LLM 的长文本建模能力。为全面评估 LLM 的长上下文能力,我们提出了 BAMBOO,一个多任务长上下文基准。BAMBOO 的设计遵循四项原则:综合能力评估、避免数据污染、精准自动评估,以及不同长度层级。它包含来自 5 类不同长文本理解任务的 10 个数据集,即问答、幻觉检测、文本排序、语言建模与代码补全,以覆盖 LLM 的核心能力与各领域。我们在 BAMBOO 上以五个长上下文模型开展实验,并进一步探讨关于长文本的四个关键研究问题。我们还定性分析了当前长上下文模型,并指出增强长文本建模能力的未来方向。我们在 https://github.com/RUCAIBox/BAMBOO 发布了数据、提示词与代码。

关键词

引用

@article{arxiv.2309.13345,
  title  = {BAMBOO: A Comprehensive Benchmark for Evaluating Long Text Modeling Capacities of Large Language Models},
  author = {Zican Dong and Tianyi Tang and Junyi Li and Wayne Xin Zhao and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2309.13345},
  year   = {2024}
}

备注

Accepted for the Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING) 2024