GSM-Infinite:您的大语言模型在无限增长的上下文长度和推理复杂度下表现如何?
计算与语言
2025-02-11 v1 人工智能
摘要
长上下文大语言模型(LLMs)近期在信息检索和长文档问答中展现出强大性能。然而,要解决最具挑战性的智力问题,LLMs必须在长而复杂的上下文中进行有效推理(例如,前沿数学研究)。研究LLMs如何处理日益增长的推理复杂度和上下文长度至关重要,但现有基准缺乏进行定量评估的坚实基础。受GSM-8K问题抽象为计算图的启发,以及通过添加不必要的节点和边引入噪声的能力,我们开发了一个小学数学问题生成器,能够在细粒度控制下生成具有无限难度和上下文长度的算术问题。利用我们新合成的GSM-Infinite基准,我们全面评估了现有的LLMs。我们发现,随着复杂度增加,推理性能呈现一致的S型下降,并伴随系统性的推理扩展趋势:指数级增加的推理计算仅带来线性的性能提升。这些发现强调了当前长上下文LLMs的根本局限性以及扩展推理能力的关键挑战。我们的GSM-Infinite基准为在长上下文和复杂上下文中系统研究和推进LLM推理提供了一个可扩展且可控的测试平台。
引用
@article{arxiv.2502.05252,
title = {GSM-Infinite: How Do Your LLMs Behave over Infinitely Increasing Context Length and Reasoning Complexity?},
author = {Yang Zhou and Hongyi Liu and Zhuoming Chen and Yuandong Tian and Beidi Chen},
journal= {arXiv preprint arXiv:2502.05252},
year = {2025}
}