相同任务,更多词元:输入长度对大语言模型推理性能的影响
计算与语言
2024-07-11 v2 人工智能
摘要
本文探讨了延长输入长度对大语言模型(LLM)能力的影响。尽管近年来LLM取得了进步,但其在不同输入长度下的性能一致性尚不明确。我们通过引入一种新颖的问答推理框架来研究这一方面,该框架专门设计用于评估输入长度的影响。我们使用同一样本的多个版本来隔离输入长度的影响,每个版本都填充了不同长度、类型和位置的填充词。我们的发现表明,在远低于其技术最大长度的输入长度下,LLM的推理性能显著下降。我们展示了这种下降趋势出现在数据集的每个版本中,尽管强度不同。此外,我们的研究揭示,传统的下一词预测指标与LLM在我们推理数据集上的性能呈负相关。我们分析了结果,并识别出失败模式,这些模式可作为未来研究的有用指南,可能为应对LLM中观察到的局限性提供策略。
引用
@article{arxiv.2402.14848,
title = {Same Task, More Tokens: the Impact of Input Length on the Reasoning Performance of Large Language Models},
author = {Mosh Levy and Alon Jacoby and Yoav Goldberg},
journal= {arXiv preprint arXiv:2402.14848},
year = {2024}
}
备注
Accepted to ACL 2024