中文

重新思考困惑度:揭示输入长度对大语言模型困惑度评估的影响

机器学习 2026-02-05 v1 计算与语言

摘要

困惑度是评估大型语言模型(LLM)预测质量的广泛采用的指标,常作为下游评估的参考指标。然而,近期证据表明,当使用无关的长输入时,困惑度可能不可靠,这引发了对基准测试和系统部署的担忧。虽然已有研究采用选择性输入过滤和精选数据集,但从系统角度系统地研究输入长度对困惑度的影响,以及将输入长度作为影响公平性和效率的首要系统变量,仍存缺失。本文通过引入LengthBenchmark,一个将输入长度、评估协议设计和系统级成本显式集成的系统导注意义框架,在不同上下文长度下,对代表性 LLM 进行两种评分协议(直接累积与固定窗口滑动)的评估。与仅关注准确性指标的先前工作不同,LengthBenchmark 还测量了延迟、内存占用和评估成本,从而将预测指标与部署现实联系起来。我们进一步将量化变体纳入作为鲁棒性检查,表明长度引起的偏差在全精度和压缩模型中均存在。该设计解耦了评估逻辑、量化和输入长度的作用,表明长度偏差是一种普遍现象,削弱了公平跨模型比较。我们的分析得出两个关键观察:(i)滑动窗口评估在短输入上一致性地高估性能;(ii)全精度和量化模型随评估片段长度增长而显现出性能提升。

关键词

引用

@article{arxiv.2602.04099,
  title  = {Rethinking Perplexity: Revealing the Impact of Input Length on Perplexity Evaluation in LLMs},
  author = {Letian Cheng and Junyan Wang and Yan Gao and Elliott Wen and Ting Dang and Hong Jia},
  journal= {arXiv preprint arXiv:2602.04099},
  year   = {2026}
}