中文

单提示准确率忽略了什么:语言模型多变体可靠性审计

计算与语言 2026-05-05 v1 人工智能

摘要

单提示准确率是衡量语言模型的主流方法,但可能忽略重要的可靠性失效。我们评估了一个包含15个开源模型的语料库,主要聚焦于10个指令模型,在五个分类与推理基准测试下,每种基准测试下设置五个提示变体,测量准确率、token概率校准、口头置信度校准、口头解析率以及提示扰动扩散,每一组合合模型、数据集、变体均进行评估。我们发现三个主要结论:第一,评估设计会显著性地改变结论。将ECE(Expected Calibration Error)的token从原始值切换到标签集归一化定义后,单细胞校准平均绝对值变化为0.149。更显著的是,在ARC-Challenge上,将链式思考提示与首字符评估器配合使用,导致所有五个主要模型的表观准确率下降72%-88%;两个独立的修复程序分别恢复了93.8%和102.7%的性能损失,表明是评估器端而非模型端的失效。第二,置信信号脆弱。在MMLU-Pro上,所有主要模型在口头报告的置信度显著高于其准确率及其在相同行数据的token概率置信度,口头解析率在单个提示变体下可能完全崩溃。第三,提示鲁棒性可靠地跟随参数数量。对于10个指令模型,模型规模与提示扰动扩散之间的相关性在不同基准测试下范围为-0.244至0.474。综上,这些结果表明,小型语言模型的可靠性结论不仅取决于所评估的模型本身,也取决于用于衡量其的评估管道。我们主张在作出可靠性声明时,应明确报告校准定义、评估器逻辑、口头可解析性及提示鲁棒性。

关键词

引用

@article{arxiv.2605.02038,
  title  = {What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models},
  author = {Ranit Karmakar and Jayita Chatterjee},
  journal= {arXiv preprint arXiv:2605.02038},
  year   = {2026}
}