中文

从人工大海捞针到真实草堆:通过在合成数据上微调提升 LLM 的检索能力

机器学习 2024-10-15 v2 人工智能 计算与语言

摘要

近期研究表明,大型语言模型在处理长上下文输入时,难以准确检索信息并保持推理能力。为了解决这些局限性,我们提出了一种微调方法,利用一个精心设计的包含数值键值检索任务的合成数据集。我们在 GPT-3.5 Turbo 和 Mistral 7B 等模型上的实验表明,在该数据集上微调 LLM 可显著提升其在更长上下文设置下的信息检索和推理能力。我们对微调后的模型进行了分析,说明了从合成任务到真实任务评估的技能迁移(例如,GPT-3.5 Turbo 在 2020 篇文档 MDQA 位置 1010 处提升了 10.5%10.5\%)。我们还发现,微调后的 LLM 在通用基准测试上的性能几乎保持不变,而在其他基线长上下文增强数据上微调的 LLM 可能会加剧幻觉(例如,在 TriviaQA 上,基于我们合成数据微调的 Mistral 7B 没有导致性能下降,而其他基线数据则会导致 2.33%2.33\%6.19%6.19\% 的下降)。我们的研究突出了在合成数据上进行微调以提升 LLM 在长上下文任务上表现的潜力。

关键词

引用

@article{arxiv.2406.19292,
  title  = {From Artificial Needles to Real Haystacks: Improving Retrieval Capabilities in LLMs by Finetuning on Synthetic Data},
  author = {Zheyang Xiong and Vasilis Papageorgiou and Kangwook Lee and Dimitris Papailiopoulos},
  journal= {arXiv preprint arXiv:2406.19292},
  year   = {2024}
}