中文

充分利用 LLM 内部状态以提升知识边界感知

计算与语言 2025-06-26 v2

摘要

大语言模型 (LLM) 在各种任务上表现出惊人的性能,但常常难以准确把握其知识边界,从而产生自信而错误的响应。本文探索了如何从效率和风险两个角度利用 LLM 的内部状态来增强其知识边界感知能力。我们研究了 LLM 是否能够在生成响应之前估计其自身的置信度,从而可能节省计算资源。我们在Natural Questions、HotpotQA 和 MMLU 等数据集上进行实验,发现 LLM 在生成前显示出显著的感知能力,这种感知在生成后得到进一步细化,但在不同条件下仍保持稳定的感知差距。为了在关键领域缓解风险,我们引入基于置信一致性的校准方法 (C3C^3),通过问题重构来评估置信度一致性。C3C^3显著提高了 LLM 识别自身知识缺口的能力,在 NQ 上提升了 5.6%,在 HotpotQA 上提升了 4.9%。我们的发现表明,生成前的置信度估计可用于优化效率,而 C3C^3有效控制了输出风险,推动了 LLM 在实际应用中的可靠性。

关键词

引用

@article{arxiv.2502.11677,
  title  = {Towards Fully Exploiting LLM Internal States to Enhance Knowledge Boundary Perception},
  author = {Shiyu Ni and Keping Bi and Jiafeng Guo and Lulu Yu and Baolong Bi and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2502.11677},
  year   = {2025}
}

备注

ACL2025 Main