中文

DENIAHL:检索长文本上下文中信息的能力受原语特征影响

计算与语言 2024-12-02 v1 人工智能 机器学习

摘要

Needle-in-a-haystack (NIAH) 测试是用于评估语言模型 (LM) 从长输入上下文中检索特定信息能力的通用任务。然而,该框架尚未提供分析除上下文长度之外,哪些因素影响 LM 区分和检索 haystack 中 needle 的能力的方法。为系统评估哪些特征影响 LM 的 NIAH 能力,我们开发了一个合成基准测试,称为 DENIAHL(Data-oriented Evaluation of NIAH for LLM's)。我们的工作扩展了前面的 NIAH 研究,通过剔除通常仅考虑上下文长度的 NIAH 特征(包括数据类型、大小和模式)进行分析。我们发现 GPT-3.5 与 LLaMA 2-7B 在 DENIAHL 上的表现存在显著差异,当特征项大小增加时,检索性能会下降,甚至当数据类型从数字更改为字母时,亦出现一定程度的性能下降。这对日益增大的上下文模型具有深远意义,表明除项目数量之外,其他因素亦影响 NIAH 能力。

关键词

引用

@article{arxiv.2411.19360,
  title  = {DENIAHL: In-Context Features Influence LLM Needle-In-A-Haystack Abilities},
  author = {Hui Dai and Dan Pechi and Xinyi Yang and Garvit Banga and Raghav Mantri},
  journal= {arXiv preprint arXiv:2411.19360},
  year   = {2024}
}