衡量 LLM 中的过度精确性:一项实证研究
地球与行星天体物理
2025-04-17 v1
摘要
最近,由于其在量化大语言模型(LLM)生成可信度方面的根本性重要性, LLM 的过度自信问题引起了广泛关注。然而,现有方法会促使\textit{黑盒 LLM} 生成其自信度(\textit{言语自信度}),这可能受到许多偏见和幻觉的影响。受认知科学中称为\textit{过度精确性}的不同方面启发,我们设计了一个框架来研究黑盒 LLM 中的过度精确性。该框架包含三个主要阶段:1) 生成、2) 精炼和3) 评估。在生成阶段,我们要求 LLM 以一定置信水平以区间形式回答数值问题。这种置信水平是在提示词中强加的,而且不需要 LLM 生成(如以往方法所需)。我们使用各种提示技术,并多次使用相同的提示词来衡量生成过程中随机性的影响。在精炼阶段,来自前一阶段的答案被精炼以生成更好的答案。在评估阶段,对 LLM 回答进行评估和研究,以了解其内部工作原理。这项研究使我们能够获得关于 LLM 过度精确性的各种见解:1) LLM 在数值任务上高度未校准 2) 区间长度与强加的置信水平之间没有相关性,这可能是a) 对置信概念理解不足或b) 无法通过遵循指令调整自我置信的表现,{3) LLM 的数值精度因任务、答案规模和提示技术而异 4) 答案的精炼在大多数情况下并不能提高精度。我们认为本研究为 LLM 的过度自信提供了新的视角,并为 LLM 中的过度精确性提供了强大的基准。
引用
@article{arxiv.2504.12097,
title = {Activity-Induced Near-Infrared Variability at 29P/Schwassmann-Wachmann 1, 2017-2022},
author = {Theodore Kareta and Charles A. Schambeau and Megan Firgard and Yanga R. Fernández},
journal= {arXiv preprint arXiv:2504.12097},
year = {2025}
}
备注
14 pages, 2 figures, 3 tables, accepted for publication in the Planetary Science Journal on April 15, 2025