中文

语言模型是否知道它们会拒绝?探究安全边界的自省意识

计算与语言 2026-04-02 v1

摘要

大型语言模型被训练以拒绝有害请求,但它们是否能在作出响应前准确预测将拒绝的行为?我们通过一次系统性研究来探索此问题:模型首先预测其拒绝行为,然后在全新上下文中作出响应。我们在3754个数据点(覆盖300个请求)上评估了四个前沿模型:Claude Sonnet 4、Claude Sonnet 4.5、GPT-5.2 和 Llama 3.1 405B。使用信号检测理论(SDT),我们发现所有模型均表现出较高的自省灵敏度(d' = 2.4-3.5),但在安全边界处灵敏度显著下降。我们观察到Claude系代际提升(Sonnet 4.5 的准确率为95.7% vs Sonnet 4 的93.0%),而GPT-5.2显示较低的准确率(88.9%)且行为更为不稳定。Llama 405B 获得较高灵敏度,但表现出强烈的拒绝偏好和较差的校准,导致整体准确率较低(80.0%)。主题层面的分析显示,针对武器相关查询是自省最具挑战性的任务。关键在于,置信度分数提供了可操作的信号:限制于高置信度预测后,经过良好校准的模型可达98.3%的准确率,从而在安全关键型部署中实现实用的基于置信度的路由。

关键词

引用

@article{arxiv.2604.00228,
  title  = {Do Language Models Know When They'll Refuse? Probing Introspective Awareness of Safety Boundaries},
  author = {Tanay Gondil},
  journal= {arXiv preprint arXiv:2604.00228},
  year   = {2026}
}

备注

11 pages, 5 figures