DENIAHL:检索长文本上下文中信息的能力受原语特征影响
计算与语言
2024-12-02 v1 人工智能
机器学习
摘要
Needle-in-a-haystack (NIAH) 测试是用于评估语言模型 (LM) 从长输入上下文中检索特定信息能力的通用任务。然而,该框架尚未提供分析除上下文长度之外,哪些因素影响 LM 区分和检索 haystack 中 needle 的能力的方法。为系统评估哪些特征影响 LM 的 NIAH 能力,我们开发了一个合成基准测试,称为 DENIAHL(Data-oriented Evaluation of NIAH for LLM's)。我们的工作扩展了前面的 NIAH 研究,通过剔除通常仅考虑上下文长度的 NIAH 特征(包括数据类型、大小和模式)进行分析。我们发现 GPT-3.5 与 LLaMA 2-7B 在 DENIAHL 上的表现存在显著差异,当特征项大小增加时,检索性能会下降,甚至当数据类型从数字更改为字母时,亦出现一定程度的性能下降。这对日益增大的上下文模型具有深远意义,表明除项目数量之外,其他因素亦影响 NIAH 能力。
关键词
引用
@article{arxiv.2411.19360,
title = {DENIAHL: In-Context Features Influence LLM Needle-In-A-Haystack Abilities},
author = {Hui Dai and Dan Pechi and Xinyi Yang and Garvit Banga and Raghav Mantri},
journal= {arXiv preprint arXiv:2411.19360},
year = {2024}
}