中文

基于短指令与合成位置的长上下文对齐

计算与语言 2024-05-08 v1

摘要

有效处理具有极长上下文的指令是大型语言模型(LLM)面临的挑战,通常需要高质量的长数据和大量计算资源。本文引入Step-Skipping Alignment(SkipAlign),一种新型技术,旨在无需额外数据训练 effort的前提下提升LLM在对齐阶段的长上下文能力。SkipAlign基于LLM长程依赖性是提升其长上下文能力的关键假设进行开发。与仅扩展输入样本长度不同,SkipAlign从位置索引的角度合成长程依赖性。通过在指令遵循样本中策略性地插入跳过的位置,利用数据的语义结构有效扩大上下文。通过在多种上下文窗口大小的基模型上进行大量实验,SkipAlign在广泛的长上下文任务中展现出良好效果。特别值得注意的是,在精心选择基模型和对齐数据集后,仅需6B参数的SkipAlign便能在LongBench上实现最佳性能,与GPT-3.5-Turbo-16K等强大基线相当。

关键词

引用

@article{arxiv.2405.03939,
  title  = {Long Context Alignment with Short Instructions and Synthesized Positions},
  author = {Wenhao Wu and Yizhong Wang and Yao Fu and Xiang Yue and Dawei Zhu and Sujian Li},
  journal= {arXiv preprint arXiv:2405.03939},
  year   = {2024}
}

备注

preview