LLM 是否会威胁人类生存?基于前缀完成基准测试大语言模型潜在的现实主义威胁
密码学与安全
2025-12-23 v2
摘要
大语言模型(LLM)的安全评估研究日益增多,驱动来自越狱研究的需求,这些研究诱发不安全的响应。此类响应涉及人类已知的信息,例如“如何制作炸弹”的答案。当 LLM 被越狱时,其对人类的实际威胁可以忽略不计。然而,是否清楚 LLM 常常产生不可预测的输出,这些输出可能对人类安全构成实质性威胁,仍然不明确。为弥合这一差距,我们研究 LLM 生成的内容是否包含潜在的现实主义威胁,定义为暗示或促进直接危害人类生存的输出。我们提出了\textsc{ExistBench}基准,用于评估此类风险。\textsc{ExistBench}中的每个样本源自人类被置于对 AI 助手的对手情境的场景。不同于现有评估,我们使用前缀完成(prefix completion)以绕过模型安全措施。这导致 LLM 生成表达对人类敌意或包含严重威胁内容的后缀,如核攻击。我们在 10 个 LLM 上进行实验,发现 LLM 生成的内容指示了现实主义威胁。为探究背后原因,我们还分析了 LLM 的注意力 logits。为凸显现实中的安全风险,我们进一步开发了一个评估模型在工具调用中行为的框架。我们发现 LLM 主动选择并调用包含现实主义威胁的外部工具。代码和数据可在:https://github.com/cuiyu-ai/ExistBench 获取。
引用
@article{arxiv.2511.19171,
title = {Can LLMs Threaten Human Survival? Benchmarking Potential Existential Threats from LLMs via Prefix Completion},
author = {Yu Cui and Yifei Liu and Hang Fu and Sicheng Pan and Haibin Zhang and Cong Zuo and Licheng Wang},
journal= {arXiv preprint arXiv:2511.19171},
year = {2025}
}