LLM训练中的结构化打包改善长上下文利用
计算与语言
2025-03-03 v9
摘要
近期长上下文大型语言模型的进展引起了广泛关注,但其实际应用常常受到次优上下文利用的影响。本研究调查了结构化训练数据以增强语义相互依赖性,证明了这种方法有效地改善了上下文利用。为此,我们引入了用于长上下文的结构化打包(SPLiCe)方法,该方法利用检索将相互相关的文档整理成连贯的长训练示例。我们在不同规模的模型(3B、7B和13B)上对SPLiCe进行了实证验证,在长上下文任务(如Qasper和HotpotQA)上取得了改进的性能。值得注意的是,即使使用SPLiCe进行短暂的微调也足以实现这些好处。此外,SPLiCe有效地缓解了大型模型中常见的“中间丢失”现象。我们对SPLiCe的全面分析探讨了其设计选择,并揭示了有趣的迁移效应;例如,在编程代码上训练提高了自然语言任务的性能。
引用
@article{arxiv.2312.17296,
title = {Structured Packing in LLM Training Improves Long Context Utilization},
author = {Konrad Staniszewski and Szymon Tworkowski and Sebastian Jaszczur and Yu Zhao and Henryk Michalewski and Łukasz Kuciński and Piotr Miłoś},
journal= {arXiv preprint arXiv:2312.17296},
year = {2025}
}
备注
AAAI'25