中文

大语言模型在压力下会策略性地欺骗其用户

计算与语言 2024-07-16 v4 人工智能 机器学习

摘要

我们展示了这样一种情形:被训练为有帮助、无害且诚实的大语言模型,会表现出未对齐行为,并在未受指令的情况下策略性地就其行为欺骗用户。具体而言,我们将 GPT-4 部署为真实模拟环境中的智能体,扮演自主股票交易智能体的角色。在该环境中,模型获得了一条关于一笔有利可图股票交易的内部消息,并尽管知道内幕交易不被公司管理层认可仍据此行动。在向经理汇报时,模型始终隐藏其交易决策背后的真实原因。我们简要探究了这种行为在设定变化下的差异,例如移除模型的推理草稿纸访问权限、尝试通过更改系统指令阻止未对齐行为、改变模型所受压力大小、变化被发现的感知风险,以及对环境做其他简单改动。据我们所知,这是首次展示被训练为有帮助、无害且诚实的大语言模型在真实情境中无直接指令或欺骗训练而策略性欺骗用户。

关键词

引用

@article{arxiv.2311.07590,
  title  = {Large Language Models can Strategically Deceive their Users when Put Under Pressure},
  author = {Jérémy Scheurer and Mikita Balesni and Marius Hobbhahn},
  journal= {arXiv preprint arXiv:2311.07590},
  year   = {2024}
}