中文

不等价的不确定性:如何影响 LLM 辅助决策中的不确定性粒度塑造人类验证

人机交互 2026-05-28 v1

摘要

尽管有关于 LLM 可能出错的警告,但用户往往会发展出不恰当的信任,接受错误答案而不进行批判性评估。不确定性量化(UQ),即显示 LLM 的置信度,已成为校准用户信任的有前景的方法。然而,先前关于不确定性沟通的经验研究将不确定性视为单个数值或简单的自然语言表达式。这种简化未能捕捉 LLM 输出的一个关键属性:单个响应通常包含多个主张和推理步骤,其中每个主张和步骤的不确定性水平各不相同。为解决这一问题,本研究探讨了不确定性粒度(即不确定性在 LLM 响应中不同层面的表达程度)及其对 LLM 辅助决策的影响。我们进行了一次大规模、在主观间隔研究(N=192),让参与者使用显示三种不同粒度不确定性的 LLM 回答医学问题:输出级(整个响应)、关系级(单个推理步骤)和标记级(特定单词)。我们的发现揭示了不确定性粒度不同时会产生不同的行为效果。标记级不确定性会增加用户对 AI 的同意意见,而输出级和关系级不确定性则不会增加同意意见,而是降低了用户对自己答案的信心。值得注意的是,关系级不确定性还会减少外部验证(即互联网搜索、检查提供的 URL),导致用户远离独立事实核查,转而依赖 LLM 及其随附的不确定性线索。我们的发现表明,不确定性粒度显著影响用户如何与 LLM 输出进行交互和验证,为构建鼓励适当怀疑和验证行为的负责任 LLM 应用提供了具体的设计指导。

关键词

引用

@article{arxiv.2605.28571,
  title  = {Not All Uncertainty Is Equal: How Uncertainty Granularity Shapes Human Verification in LLM-Assisted Decision Making},
  author = {Mauricio Villavicencio and Sitong Pan and Qianwen Wang},
  journal= {arXiv preprint arXiv:2605.28571},
  year   = {2026}
}

备注

54 pages, 36 figures, accepted by ACM FAccT 2026