LLM的一个引人注目的故障的高效解决方案:长上下文窗口不等于LLM能完美分析长序列
计算与语言
2024-12-23 v3 机器学习
摘要
大型语言模型(LLM)因其广泛的上下文窗口而在理解和分析长序列输入方面表现出惊人的能力,能够在单次前向传递中处理数百万个标记。然而,本文揭示了一个惊人的局限性:LLM在处理长输入序列时仍显不足。我们使用三个数据集和两个任务(情感分析和新闻分类) across various LLMs,包括Claude 3、Gemini Pro、GPT 3.5 Turbo、Llama 3 Instruct和Mistral Instruct模型进行了此问题的调查。为解决这一局限性,我们提出并评估了一些临时解决方案,通过提高LLM在长输入序列上的性能,最多可提升50%,同时将API成本和延迟分别降低最高可达93%和50%。
引用
@article{arxiv.2408.01866,
title = {Efficient Solutions For An Intriguing Failure of LLMs: Long Context Window Does Not Mean LLMs Can Analyze Long Sequences Flawlessly},
author = {Peyman Hosseini and Ignacio Castro and Iacopo Ghinassi and Matthew Purver},
journal= {arXiv preprint arXiv:2408.01866},
year = {2024}
}
备注
12 pages, 5 figures, 7 tables