中文

职责所在:通过可行性边界的一致性评估 LLM 自我认知

计算与语言 2025-09-16 v1 人工智能

摘要

随着 LLM 变得越来越强大,其最深刻的成就可能在于知道何时说“我不知道”。现有关于 LLM 自我认知的研究在很大程度上受限于人类定义的可行性概念,往往忽视了 LLM 无法回答的原因,且未能研究自我认知的缺陷类型。本研究旨在通过一种新颖的方法获得对不同类型 LLM 自我认知的内在洞察:允许它们灵活地设定自己的可行性边界,然后分析这些边界的一致性。我们发现,超过 80% 的情况下,即使是 GPT-4o 和 Mistral Large 等前沿模型也不确定自身的能力,这凸显了其响应中显著缺乏可信度。我们对 LLM 置信度平衡的分析表明,模型在可行性边界上的表现会在过度自信和保守之间波动,具体取决于任务类别,并且最显著的自我认知弱点在于时间感知和上下文理解。这些上下文理解上的困难还导致模型质疑其操作边界,从而在 LLM 的自我认知中造成相当大的混乱。我们在 https://github.com/knowledge-verse-ai/LLM-Self_Knowledge_Eval 公开发布了我们的代码和结果。

关键词

引用

@article{arxiv.2503.11256,
  title  = {Line of Duty: Evaluating LLM Self-Knowledge via Consistency in Feasibility Boundaries},
  author = {Sahil Kale and Vijaykant Nadadur},
  journal= {arXiv preprint arXiv:2503.11256},
  year   = {2025}
}

备注

14 pages, 8 figures, Accepted to the 5th TrustNLP Workshop at NAACL 2025