中文

穿针:LLM 能否在近百万规模的 haystack 中跟随线索?

计算与语言 2025-04-24 v2

摘要

随着大型语言模型(LLM)的上下文限制增加,可能的应用和下游功能范围也在扩大。在许多真实任务中,决策依赖于散布在通常各不相同的文档集合中的细节,而这些文档大多包含不相关的信息。长上下文 LLM 似乎非常适合这种复杂的信息检索和推理形式,而传统上这已被证明是昂贵且耗时的。然而,尽管更长上下文模型的开发近年来取得了快速进展,但我们对这些 LLM 如何有效利用其上下文的理解并未跟上步伐。为解决这一问题,我们进行了一组检索实验,旨在评估 17 个主流 LLM 的能力,例如它们通过上下文窗口跟随信息线索的能力。引人注目的是,我们发现许多模型具有显著的线索跟随能力:能够在不显著损失性能的同时同时跟随多条线索。尽管如此,对于许多模型,我们发现有效上下文限制显著短于支持的上下文长度,且准确率随上下文窗口的增大而降低。我们的研究还强调了一个重要观点,即来自不同分词器的 token 计数不应直接比较——它们通常对应着截然不同的书写字符数量。我们发布了我们的代码和长上下文实验数据。

关键词

引用

@article{arxiv.2411.05000,
  title  = {Needle Threading: Can LLMs Follow Threads through Near-Million-Scale Haystacks?},
  author = {Jonathan Roberts and Kai Han and Samuel Albanie},
  journal= {arXiv preprint arXiv:2411.05000},
  year   = {2025}
}

备注

Accepted at ICLR 2025