中文

大语言模型在概率置信度与语言化置信度上是否更诚实?

计算与语言 2024-08-20 v1

摘要

研究发现,当问题超出大语言模型(LLM)的内部知识边界时,模型会产生幻觉。一个可靠的模型应清晰感知其知识边界,在其范围内提供正确答案,并在缺乏知识时拒绝回答。现有关于LLM对其知识边界感知的研究通常使用生成token的概率或语言化置信度作为模型对其回答的置信度。然而,这些研究忽略了两者之间的差异与联系。在本文中,我们对LLM的概率感知与语言化感知进行了全面的分析与比较。首先,我们研究了这两种感知的优缺点。然后,我们研究了它们在频率不同的问题下如何变化。最后,我们测量了LLM的概率置信度与语言化置信度之间的相关性。实验结果表明:1)LLM的概率感知通常比语言化感知更准确,但需要领域内验证集来调整置信度阈值;2)两种感知在频率较低的问题上表现更好;3)LLM难以用自然语言准确表达其内部置信度。

关键词

引用

@article{arxiv.2408.09773,
  title  = {Are Large Language Models More Honest in Their Probabilistic or Verbalized Confidence?},
  author = {Shiyu Ni and Keping Bi and Lulu Yu and Jiafeng Guo},
  journal= {arXiv preprint arXiv:2408.09773},
  year   = {2024}
}