中文

解读与缓解LLM中不必要的不确定性

计算与语言 2025-10-28 v1 机器学习

摘要

尽管大语言模型(LLM)展现了惊人的能力,但它们 exhibits 不必要的不确定性,这种现象表现为模型在重新提示时将先前正确的答案更改为错误答案。这种行为削弱了信任,并在高风险领域引发严重问题。本文研究驱动这一现象的机制。我们采用针头在 haystack 检索框架并集成翻转风格的重新评估提示,以模拟现实的答案翻转情境。我们发现检索头并非主要负责避免不确定性。相反,我们识别出一小组非检索注意力头在不确定情境中对误导性标记注意力不成比例。屏蔽这些头可显著改善情况,在不引入不连贯性或过度纠正的前提下,将翻转行为降低最高可达15%。然而,在测试下游任务时,我们观察到翻转行为与 flip 行为之间存在权衡。我们的发现为日益增长的机制可解释性领域做出贡献,并提出一种简单而有效的技术,用于缓解LLM中由不确定性导致的失败模式。

关键词

引用

@article{arxiv.2510.22866,
  title  = {Interpreting and Mitigating Unwanted Uncertainty in LLMs},
  author = {Tiasa Singha Roy and Ayush Rajesh Jhaveri and Ilias Triantafyllopoulos},
  journal= {arXiv preprint arXiv:2510.22866},
  year   = {2025}
}