中文

重缩放置信度:尺度设计揭示LLM元认知

人工智能 2026-03-11 v1

摘要

语言化置信度(即LLM报告数值确定性评分)广泛用于估计黑盒环境中的不确定性,但置信度尺度(通常为0--100)本身很少被检视。我们表明,这一设计选择并非中性。在六个LLM和三个数据集上,语言化置信度高度离散化,其中超过78%的响应集中在仅三个圆整数值上。为调查这一现象,我们系统性地沿着三个维度操控置信度尺度:粒度、边界置位和范围规则性,并使用meta-d'评估元认知灵敏度。我们发现,0--20尺度在标准0--100格式下持续改进元认知效率,而边界压缩会降低性能,圆整数偏好即使在不规则范围下仍然 persists。这些结果表明,置信度尺度设计直接影响语言化不确定性的质量,应被视为LLM评估中的一级实验变量。

关键词

引用

@article{arxiv.2603.09309,
  title  = {Rescaling Confidence: What Scale Design Reveals About LLM Metacognition},
  author = {Yuyang Dai},
  journal= {arXiv preprint arXiv:2603.09309},
  year   = {2026}
}

备注

18 pages, 5 figures