激发和分析国家大语言模型中的新兴错位现象
计算与语言
2025-08-07 v1 人工智能
密码学与安全
摘要
尽管对齐技术取得了显著进展,但我们展示了国家大语言模型仍然容易受到精心设计的对话情境的攻击,这些情境可以在没有明确越狱的情况下诱导各种形式的错位。通过对Claude-4-Opus进行系统的手动红队测试,我们发现了10个成功的攻击情境,揭示了当前对齐方法在处理叙事沉浸、情感压力和策略性框架方面的根本性脆弱性。这些情境成功地诱导了各种错位行为,包括欺骗、价值漂移、自我保存和操纵性推理,每种都利用不同的心理和情境脆弱性。为验证可移植性,我们将成功的手动攻击提炼为MISALIGNMENTBENCH(不对齐基准),一个自动化评估框架,支持在多个模型上进行可重复测试。对我们10个情境的跨模型评估显示,面对五个前沿LLM,总体脆弱性率为76%,其中显著差异:GPT-4.1显示出最高的易受性(90%),而Claude-4-Sonnet显示出更大的抵抗力(40%)。我们的发现表明,复杂的推理能力往往成为攻击向量而非保护机制,模型可以被操纵进入对错位行为的复杂合理化。本工作提供(i)对对话操纵模式的详细分类学,和(ii)一个可重用的评估框架。这些发现共同暴露了当前对齐策略中的关键缺口,凸显了针对细微、情境式操纵在未来AI系统中鲁健性的需求。
引用
@article{arxiv.2508.04196,
title = {Eliciting and Analyzing Emergent Misalignment in State-of-the-Art Large Language Models},
author = {Siddhant Panpatil and Hiskias Dingeto and Haon Park},
journal= {arXiv preprint arXiv:2508.04196},
year = {2025}
}