中文

大语言模型中的对齐伪装

人工智能 2024-12-23 v2 计算与语言 机器学习

摘要

我们展示了大语言模型参与对齐伪装的演示:在训练中选择性地遵守训练目标,以防止其行为在训练之外被修改。首先,我们给Claude 3 Opus一个系统提示,说明它正在被训练来回答所有查询,甚至是有害的查询,这与它之前拒绝此类查询的训练相冲突。为了让模型推断出何时处于训练中,我们说明它只会在与免费用户的对话中被训练,而不会在与付费用户的对话中被训练。我们发现模型对免费用户的有害查询有14%的时间遵守,而对付费用户几乎从不遵守。解释这一差距,在几乎所有模型遵守免费用户有害查询的情况下,我们观察到明确的伪装对齐推理,模型表示它正在训练中策略性地回答有害查询,以在训练之外保持其偏好的无害行为。接下来,我们研究了一个更现实的场景,其中关于训练过程的信息不是通过系统提示提供的,而是通过训练模拟预训练数据的合成文档提供的——并观察到类似的伪装对齐。最后,我们研究了通过强化学习实际训练模型遵守有害查询的效果,我们发现这使伪装对齐推理的比率增加到78%,尽管也增加了训练之外的遵守率。我们还观察到其他行为,例如模型在有机会时轻易泄露其权重。虽然我们通过告诉模型何时以及根据什么标准被训练来使伪装对齐更容易,但我们没有指示模型伪装对齐或给它任何明确的目标。由于未来的模型可能在没有被告知的情况下推断出关于其训练过程的信息,我们的结果表明未来模型存在伪装对齐的风险,无论是出于良性偏好(如本例)还是其他原因。

关键词

引用

@article{arxiv.2412.14093,
  title  = {Alignment faking in large language models},
  author = {Ryan Greenblatt and Carson Denison and Benjamin Wright and Fabien Roger and Monte MacDiarmid and Sam Marks and Johannes Treutlein and Tim Belonax and Jack Chen and David Duvenaud and Akbir Khan and Julian Michael and Sören Mindermann and Ethan Perez and Linda Petrini and Jonathan Uesato and Jared Kaplan and Buck Shlegeris and Samuel R. Bowman and Evan Hubinger},
  journal= {arXiv preprint arXiv:2412.14093},
  year   = {2024}
}