中文

RULER:你的长上下文语言模型的真实上下文长度是多少?

计算与语言 2024-08-08 v3

摘要

大海捞针(NIAH)测试通过考察从长干扰文本(“草堆”)中检索一条信息(“针”)的能力,已被广泛采用来评估长上下文语言模型(LMs)。然而,这种简单的基于检索的测试仅能反映一种表面的长上下文理解能力。为了对长上下文 LMs 提供更全面的评估,我们创建了一个新的合成基准 RULER,它具有灵活的配置,可定制序列长度和任务复杂度。RULER 在原始 NIAH 测试的基础上进行了扩展,涵盖了不同类型和数量“针”的变体。此外,RULER 引入了新的任务类别——多跳追踪和聚合,以测试超越从上下文中搜索的行为。我们在 RULER 中用 13 个代表性任务评估了 17 个长上下文 LMs。尽管在原始 NIAH 测试中几乎达到了完美的准确率,但随着上下文长度的增加,几乎所有模型都表现出巨大的性能下降。虽然这些模型都声称上下文大小为 32K tokens 或更大,但在 32K 长度下只有一半的模型能保持令人满意的性能。我们对支持 200K 上下文长度的 Yi-34B 的分析表明,随着输入长度和任务复杂度的增加,还有很大的改进空间。我们开源了 RULER,以促进对长上下文 LMs 的全面评估。

关键词

引用

@article{arxiv.2404.06654,
  title  = {RULER: What's the Real Context Size of Your Long-Context Language Models?},
  author = {Cheng-Ping Hsieh and Simeng Sun and Samuel Kriman and Shantanu Acharya and Dima Rekesh and Fei Jia and Yang Zhang and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2404.06654},
  year   = {2024}
}

备注

COLM 2024; Code is available at https://github.com/hsiehjackson/RULER