中文

大语言模型能否拒绝不了解的问题?——基于事实任务的知识感知拒答测量

计算与语言 2026-05-19 v2 人工智能

摘要

大语言模型(LLMs)应拒绝其知识范围之外的问题。这种能力被称为知识感知拒答(knowledge-aware refusal),是事实可靠性的关键,而现有指标未能捕捉这一能力。本文提出了拒绝指数(Refusal Index, RI),作为一种新颖且原则化的指标,衡量大语言模型拒绝自身不了解问题的准确性。我们将 RI 定义为拒绝概率与错误概率之间斯皯尔曼等级相关系数。RI 可通过仅需观察两种标准评估运行中拒绝率的轻量级双 pass 评估方法进行实测。广泛的实验在 16 个模型和 5 个数据集上表明,RI 能准确量化模型的知识感知拒答能力。值得注意的是,RI 在不同的拒绝率下保持稳定,并能独立于模型整体准确率和拒绝率提供一致的模型排名。这些特性表明 RI 捕捉到了模型知识校准的稳定、内在方面。更重要的是,RI 为大语言模型事实性提供的重要但此前被忽视的方面提供了洞见:尽管大语言模型在事实任务上取得高准确率,但其拒答行为可能不可靠且脆弱。

关键词

引用

@article{arxiv.2510.01782,
  title  = {Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks},
  author = {Wenbo Pan and Jie Xu and Qiguang Chen and Junhao Dong and Libo Qin and Xinfeng Li and Haining Yu and Xiaohua Jia},
  journal= {arXiv preprint arXiv:2510.01782},
  year   = {2026}
}

备注

Accepted at ICLR 2026