中文

SelfReflect:LLM 能否传达其内部答案分布?

计算与语言 2026-02-06 v4 人工智能 机器学习 机器学习

摘要

传达大型语言模型(LLM)不确定性的常见方法是向其回复中添加百分比数字或模糊限制词。但这就是我们能做的全部吗?一个对用户完全透明的 LLM,不是生成单个答案然后对其进行模糊处理,而是需要能够反思其内部信念分布,并输出它认为所有可能的选项及其可能性的摘要。为了测试 LLM 是否具备这种能力,我们开发了 SelfReflect 指标,即给定摘要与答案分布之间的信息论距离。在干预性研究和人类研究中,我们发现 SelfReflect 能够指示即使是轻微的偏差,从而为摘要字符串与 LLM 实际内部答案分布之间提供了一种精细的忠实度度量。通过 SelfReflect,我们得出了一个响亮的否定结论:现代 LLM 普遍无法揭示它们不确定的内容,无论是通过推理、思维链,还是显式微调。然而,我们确实发现,如果我们通过采样多个输出并将其反馈到上下文中来帮助 LLM,它们能够生成关于其不确定性的忠实摘要。这种简单的方法为传达 LLM 不确定性指明了一种通用方式,而 SelfReflect 分数将推动其未来的发展。为了支持这种通用形式的 LLM 不确定性研究的发展,我们在 https://github.com/apple/ml-selfreflect 上发布了为任意 LLM 实现我们指标的代码。

关键词

引用

@article{arxiv.2505.20295,
  title  = {SelfReflect: Can LLMs Communicate Their Internal Answer Distribution?},
  author = {Michael Kirchhof and Luca Füger and Adam Goliński and Eeshan Gunesh Dhekane and Arno Blaas and Seong Joon Oh and Sinead Williamson},
  journal= {arXiv preprint arXiv:2505.20295},
  year   = {2026}
}

备注

Accepted at ICLR 2026