面向长上下文 Needle-In-A-Haystack 的统一RAG与LLM评估框架——U-NIAH
计算与语言
2025-03-04 v1 信息检索
摘要
近年来,大型语言模型(LLM)的上下文窗口规模不断扩展,引发了关于检索增强生成(RAG)是否必要的讨论。为解决现有 Needle-in-a-Haystack(NIAH)评估方法碎片化且案例有限的问题,本文提出一种统一框架 U-NIAH,系统比较 LLM 与 RAG 方法在受控长上下文环境中的表现。该框架超越传统 NIAH,融合多针、长针和针在针配置,以及不同的检索设置,同时采用合成的 Starlight Academy 数据集——一个虚构的魔法世界——以消除预训练知识的偏见。通过大量实验,我们探讨了三个研究问题:(1)LLM 与 RAG 的性能权衡,(2)RAG 中的错误模式,(3)RAG 在复杂场景中的局限性。我们的发现表明,RAG 在缓解“lost-in-the-middle”效应并提升鲁棒性方面显著提升较小规模的 LLM,实现了 82.58% 的优势。然而,我们观察到检索噪声和逆序块排列会降低性能,而令人意外的是,先进的推理 LLM 因对语义干扰物的敏感性,显示出较低的 RAG 兼容性。我们识别了典型的错误模式,包括因噪声导致的遗漏、在高噪声严重条件下的幻觉,以及自怀疑行为。我们的工作不仅凸显了 RAG 与 LLM 的互补作用,还为优化部署提供了可操作的见解。代码:https://github.com/Tongji-KGLLM/U-NIAH。
引用
@article{arxiv.2503.00353,
title = {U-NIAH: Unified RAG and LLM Evaluation for Long Context Needle-In-A-Haystack},
author = {Yunfan Gao and Yun Xiong and Wenlong Wu and Zijing Huang and Bohan Li and Haofen Wang},
journal= {arXiv preprint arXiv:2503.00353},
year = {2025}
}