以“复述原始文本”进行训练教导 LLM 在长上下文任务中更好地检索
计算与语言
2024-12-13 v9 人工智能
摘要
随着大型语言模型(LLM)的不断发展,越来越多的模型被设计用于处理长上下文输入。尽管取得了这些进展,但大多数模型在准确处理长上下文任务时仍面临挑战,常表现出“迷失在中间”问题。我们发现,检索能力不足是导致该问题的重要原因之一。为应对这一挑战,我们提出一种为长上下文任务设计训练数据的新方法,旨在增强 LLM 从长上下文中提取关键信息的能力。具体而言,我们在构建训练样本的答案时加入了一个名为“复述原始文本”的额外部分,随后对模型进行微调。在 LongBench 和 NaturalQuestions Multi-document-QA 数据集上,使用 Llama 和 Qwen 系列模型进行实验,我们的方法在平均分上分别取得了高达 8.48% 和 4.48% 的提升,表明了其在改善模型长上下文任务性能方面的有效性。
引用
@article{arxiv.2312.11193,
title = {Training With "Paraphrasing the Original Text" Teaches LLM to Better Retrieve in Long-context Tasks},
author = {Yijiong Yu and Yongfeng Huang and Zhixiao Qi and Zhe Zhou},
journal= {arXiv preprint arXiv:2312.11193},
year = {2024}
}
备注
Our code and datasets are available at https://github.com/yuyijiong/train_with_paraphrasing