中文

你的 LLM 多久会灾难性崩溃?对话中的风险认证

人工智能 2026-02-06 v3 密码学与安全 机器学习

摘要

大型语言模型(LLM)在对话场景中可能产生具有严重风险的灾难性响应,这对公共安全和安全构成严重威胁。现有评估方法往往未能充分揭示这些漏洞,因为它们依赖固定的攻击提示序列、缺乏统计保障,且无法扩展到广泛的多轮对话空间。本文提出 C3^3LLM,一种新颖且原则性的统计认证框架,用于对 LLM 在多轮对话中的灾难性风险认证,该框架具备统计保障,能够界定 LLM 在多轮对话分布下生成灾难性响应的概率。我们将多轮对话建模为查询序列上的概率分布,通过表示为查询图上马尔可夫过程的模型,其中边缘编码语义相似性以捕捉真实对话流程,并置信区间量化灾难性风险。我们定义了几种低成本且实用的分布——随机节点、图路径和自适应拒绝采样。我们的实验结果表明,这些分布能够揭示前沿模型中 substantial 的灾难性风险,最差模型的认证下界可达70%,凸显了针对前沿 LLM 进行改进安全训练策略的紧迫需求。

关键词

引用

@article{arxiv.2510.03969,
  title  = {How Catastrophic is Your LLM? Certifying Risk in Conversation},
  author = {Chengxiao Wang and Isha Chaudhary and Qian Hu and Weitong Ruan and Rahul Gupta and Gagandeep Singh},
  journal= {arXiv preprint arXiv:2510.03969},
  year   = {2026}
}

备注

Accepted by ICLR 2026