中文

长上下文并非长久:面向大语言模型的长依赖数据探索

计算与语言 2024-05-29 v1

摘要

长上下文建模能力是大语言模型(LLM)在各种应用中重要的能力。然而,直接使用长上下文窗口训练 LLM 并不足以提升这一能力,因为某些训练样本在长上下文中未表现出强大的语义依赖。在本研究中,我们提出了一个数据挖掘框架 \textbf{ProLong},为每个训练样本分配一个长依赖得分,可用于排序和筛选对增强 LLM 长上下文建模能力更有利的样本。具体而言,我们首先使用 delta 概率得分来衡量给定文档中文本片段之间的 \textit{依赖强度}。随后,基于这些片段的 \textit{依赖距离} 对该指标进行细化,以纳入跨长上下文的空间关系。最终结果通过 \textit{依赖特异性} 指标进行校准,以防止由重复模式引入的平凡依赖。此外,提出一种随机抽样方法以优化 ProLong 的计算效率。多项基准测试的全面实验表明,ProLong 有效地识别携带长依赖的文档,而在这些文档上训练的 LLM 在长上下文建模能力上表现显著优于现有方法。

关键词

引用

@article{arxiv.2405.17915,
  title  = {Long Context is Not Long at All: A Prospector of Long-Dependency Data for Large Language Models},
  author = {Longze Chen and Ziqiang Liu and Wanwei He and Yunshui Li and Run Luo and Min Yang},
  journal= {arXiv preprint arXiv:2405.17915},
  year   = {2024}
}

备注

13 pages, 5 figures, ACL 2024