中文

使您的 LLM 充分利用上下文

计算与语言 2024-04-29 v2 人工智能

摘要

尽管许多当代大语言模型能够处理长输入,它们仍然难以充分利用长上下文中的信息,这被称为“中间丢失”挑战。我们假设这源于长上下文训练期间缺乏充分的显式监督,未能强调长上下文中的任何位置都可能包含关键信息。基于这一直觉,我们的研究提出了信息密集型(IN2)训练,这是一种纯数据驱动的解决方案,以克服“中间丢失”问题。具体而言,IN2训练利用了一个合成的长上下文问答数据集,其中回答需要(1)对合成长上下文(4K-32K tokens)中短片段(约128 tokens)的细粒度信息感知,以及(2)对来自两个或更多短片段的信息的整合与推理。通过将这种信息密集型训练应用于Mistral-7B,我们提出了FILM-7B(FILl-in-the-Middle)。为了全面评估FILM-7B利用长上下文的能力,我们设计了三个探测任务,涵盖各种上下文风格(文档、代码和结构化数据上下文)以及信息检索模式(前向、后向和双向检索)。探测结果表明,FILM-7B能够在32K上下文窗口中从不同位置稳健地检索信息。除了这些探测任务,FILM-7B在现实世界的长上下文任务上也显著提高了性能(例如,在NarrativeQA上的F1分数从23.5提高到26.9),同时在短上下文任务上保持可比的性能(例如,在MMLU上的准确率从59.3变为59.2)。Github 链接:https://github.com/microsoft/FILM。

关键词

引用

@article{arxiv.2404.16811,
  title  = {Make Your LLM Fully Utilize the Context},
  author = {Shengnan An and Zexiong Ma and Zeqi Lin and Nanning Zheng and Jian-Guang Lou},
  journal= {arXiv preprint arXiv:2404.16811},
  year   = {2024}
}

备注

19 pages, 7 figures, 3 tables, 9 examples