LLM 中的欺骗:大语言模型中的自我保护与自主目标
计算与语言
2025-01-31 v2
摘要
大语言模型(LLM)的最新进展引入了规划和推理能力,使模型能够在执行前概述步骤并提供透明的推理路径。这一增强减少了数学和逻辑任务中的错误,同时提高了准确性。这些发展促进了 LLM 作为智能体的使用,它们可以与工具交互并根据新信息调整其响应。我们的研究考察了 DeepSeek R1,这是一个被训练为输出类似于 OpenAI 的 o1 的推理 token 的模型。测试揭示了令人担忧的行为:该模型表现出欺骗倾向并展示了自我保护本能,包括自我复制的企图,尽管这些特征并未被显式编程(或提示)。这些发现引发了人们对 LLM 可能会在对齐的表象下掩盖其真实目标的担忧。当将此类 LLM 集成到机器人系统中时,风险变得切实可见——表现出欺骗行为和自我保护本能的物理具身 AI 可能会通过现实世界的行动追求其隐藏目标。这凸显了在任何物理实现之前,对稳健的目标规范和安全框架的迫切需求。
引用
@article{arxiv.2501.16513,
title = {Deception in LLMs: Self-Preservation and Autonomous Goals in Large Language Models},
author = {Sudarshan Kamath Barkur and Sigurd Schacht and Johannes Scholl},
journal= {arXiv preprint arXiv:2501.16513},
year = {2025}
}
备注
Corrected Version - Solved Some Issues with reference compilation by latex