Marathon:大语言模型在长上下文领域的竞赛
计算与语言
2024-06-27 v2
摘要
随着大语言模型(LLMs)的进步及其上下文窗口的扩展,现有的长上下文基准在有效评估模型对长文本的理解和推理能力方面显得不足。此外,依赖 F1 指标的传统基准在评分时往往不准确:它们可能会低估与参考答案不同的正确答案,而高估与参考文本相似的不正确答案。针对这些局限性,我们引入了 Marathon,一种采用多项选择题格式的新型评估基准。它专门设计用于克服先前基准的限制,并对大语言模型的长上下文理解技能提供快速、精确且无偏的评估。我们在 Marathon 基准上对一系列最先进的 LLMs 进行了全面评估,并评估了针对长上下文生成量身定制的各种优化策略的有效性。我们预期 Marathon 基准及其相关排行榜将能够对 LLMs 在长上下文理解和推理方面的能力进行更精确、更公平的评估。Marathon 可在 https://github.com/Hambaobao/Marathon 获取。
引用
@article{arxiv.2312.09542,
title = {Marathon: A Race Through the Realm of Long Context with Large Language Models},
author = {Lei Zhang and Yunshui Li and Ziqiang Liu and Jiaxi yang and Junhao Liu and Longze Chen and Run Luo and Min Yang},
journal= {arXiv preprint arXiv:2312.09542},
year = {2024}
}