Counting-Stars:面向长上下文大型语言模型的多证据、位置感知且可扩展的基准测试
计算与语言
2024-12-25 v5
摘要
尽管近期在开发具有强大长上下文能力的大型语言模型方面做出了努力,但由于缺乏长上下文基准测试,人们对其性能知之甚少。为了弥补这一空白,在本文中,我们提出了 \textbf{Counting-Stars},这是一个多证据、位置感知且可扩展的基准测试,旨在评估长上下文 LLM 的多证据检索能力。\textbf{Counting-Stars} 包含两个基于计数的多个证据检索子任务:搜索和推理。使用 Counting-Stars,我们进行了实验以评估几种长上下文 LLM,包括 GPT-4 Turbo、Gemini 1.5 Pro、Claude3 Opus、GLM-4 和 Moonshot-v1。广泛的实验结果表明,Gemini 1.5 Pro 取得了最佳的整体结果,而 GPT-4 Turbo 在各种任务中表现出最稳定的性能。此外,我们对这些已扩展以处理长上下文场景的 LLM 的分析表明,随着输入上下文长度和任务复杂性的增加,仍有很大的改进空间。
引用
@article{arxiv.2403.11802,
title = {Counting-Stars: A Multi-evidence, Position-aware, and Scalable Benchmark for Evaluating Long-Context Large Language Models},
author = {Mingyang Song and Mao Zheng and Xuan Luo},
journal= {arXiv preprint arXiv:2403.11802},
year = {2024}
}
备注
Accepted by COLING 2025