GPT-5 与其他大语言模型在长短上下文性能上的比较
计算与语言
2026-02-25 v1 人工智能
人机交互
摘要
随着大语言模型(LLMs)上下文窗口的显著扩展,这些模型理论上能够在单次处理中处理数百万个词元。然而,研究表明,这种理论容量与模型在长上下文中稳健利用信息的实际能力之间存在显著差距,尤其是在需要全面理解大量细节的任务中。本文评估了四个最先进模型(Grok-4、GPT-4、Gemini 2.5 和 GPT-5)在长短上下文任务上的性能。为此,使用了三个数据集:两个用于检索烹饪食谱和数学问题的辅助数据集,以及一个包含 2 万条社交媒体帖子用于抑郁症检测的主要数据集。结果表明,当社交媒体数据集上的输入量超过 5 千条帖子(7 万个词元)时,所有模型的性能都显著下降,对于 2 万条帖子,准确率降至约 50-53%。值得注意的是,在 GPT-5 模型中,尽管准确率急剧下降,但其精确率仍保持在约 95% 的高水平,这一特性对于抑郁症检测等敏感应用可能非常有效。这项研究还表明,“迷失在中间”的问题在较新的模型中已基本得到解决。本研究强调了模型在复杂、高容量数据任务上的理论容量与实际性能之间的差距,并突出了超越简单准确率的指标对于实际应用的重要性。
引用
@article{arxiv.2602.14188,
title = {GPT-5 vs Other LLMs in Long Short-Context Performance},
author = {Nima Esmi and Maryam Nezhad-Moghaddam and Fatemeh Borhani and Asadollah Shahbahrami and Amin Daemdoost and Georgi Gaydadjiev},
journal= {arXiv preprint arXiv:2602.14188},
year = {2026}
}
备注
10 pages, 7 figures. Accepted for publication in the 3rd International Conference on Foundation and Large Language Models (FLLM2025). IEEE. The final version will be available in IEEE Xplore