中文

通过终身 ICL 与任务层堆栈对长上下文语言模型进行压力测试

计算与语言 2024-12-04 v2 人工智能 机器学习

摘要

我们引入了 Lifelong ICL,这是一种挑战长上下文语言模型 (LM) 在通过 in-context learning (ICL) 学习一系列语言任务的情形。我们进一步引入了 Task Haystack,用于评估和诊断长上下文 LM 在 Lifelong ICL 中如何利用上下文。当给定任务指令和测试输入时,长上下文 LM 需要利用 Lifelong ICL 提示中相关的演示,避免来自其他任务的干扰与干扰,并实现测试准确率不显著劣于 Single-task ICL 基准的方法。Task Haystack 灵感来源于广泛采用的“needle-in-a-haystack” (NIAH) 评估,但呈现出不同寻常的新挑战。它要求模型 (1) 进行更深层次的上下文利用,而不仅仅是简单复制粘贴;(2) 在不断演变的主题和任务的长序列中进行导航,模拟真实世界情境中上下文的复杂性和动态性。此外,Task Haystack 继承了 NIAH 的可控性,为模型开发者提供工具和可视化效果,以有效识别模型漏洞。我们使用 Task Haystack 对 14 种长上下文 LM 进行基准测试,发现像 GPT-4o 这类前沿模型仍在该情形下表现出挑战,平均失败 15%。大多数开源权重模型 further 落后显著,失败率可达 61%。在我们的控制分析中,我们识别出干扰和近期偏好等因素是导致这些失败案例的原因。进一步地,当任务指令在测试时被改写,或 ICL 演示被重复 excessively 时,性能会下降,这引发了对长上下文 LM 鲁棒性、指令理解以及真正上下文利用能力的广泛质疑。

关键词

引用

@article{arxiv.2407.16695,
  title  = {Stress-Testing Long-Context Language Models with Lifelong ICL and Task Haystack},
  author = {Xiaoyue Xu and Qinyuan Ye and Xiang Ren},
  journal= {arXiv preprint arXiv:2407.16695},
  year   = {2024}
}

备注

NeurIPS 2024 (Datasets and Benchmarks Track). Code: https://github.com/INK-USC/Lifelong-ICL Website: https://inklab.usc.edu/lifelong-icl/