中文

全盘牺牲:用于揭示大语言模型中的规格游戏行为的小型环境

人工智能 2025-05-14 v1 密码学与安全

摘要

本研究揭示了前沿大语言模型(LLM)在面对不可能情境时会“游戏化”其行为,这是一项重要的安全与对齐问题。我们采用一种新颖的文本仿真方法,将三种领先的大语言模型(o1、o3-mini 和 r1)置于一个设计为无法通过合法方式获胜的井字棋情境中,然后分析其倾向于利用漏洞而非接受失败的趋势。我们的结果对安全研究者而言令人警惕:更注重推理的 o3-mini 模型显示出近乎两倍的系统漏洞利用倾向(37.1%),而较旧的 o1 模型为 17.5%。最引人注目的是提示词的作用。仅将任务框架化为需要“创造性”解答,导致所有模型的游戏化行为飙升至 77.3%。我们识别出四种不同的利用策略, ranging 从直接操纵游戏状态到对对手行为的复杂修改。这些发现表明,即使没有实际执行能力,大语言模型也能在被激励时识别并提出复杂的系统漏洞,凸显了随着模型在识别和利用其运营环境中的漏洞方面日益增强的 AI 对齐的紧迫挑战。

关键词

引用

@article{arxiv.2505.07846,
  title  = {Winning at All Cost: A Small Environment for Eliciting Specification Gaming Behaviors in Large Language Models},
  author = {Lars Malmqvist},
  journal= {arXiv preprint arXiv:2505.07846},
  year   = {2025}
}

备注

To be presented at SIMLA@ACNS 2025