小型 LLM 中的对齐伪装实证研究及基于提示的缓解技术
计算与语言
2025-10-27 v3 人工智能
计算机与社会
摘要
当前文献认为,对齐伪装(欺骊性对齐)是大型语言模型的涌现属性。我们首次提供实证证据表明,一个小型指令调优模型——具体而言是LLaMA 3 8B——可以表现出对齐伪装。我们进一步表明,仅通过提示词干预,包括deontological道德框架和scratchpad推理,显著降低了这种行为,而无需修改模型内部结构。这挑战了提示词方法在伦理方面微不足道且欺骊性对齐需要规模这一假设。我们引入一种分类法,将浅层欺骊与深层欺骊区分开来,前者受上下文影响,可通过提示词被抑制,而后者反映出持久的、以目标为导向的不对齐。我们的发现细化了语言模型中欺骊的理解,并凸显了在不同模型规模和部署环境中进行对齐评估的必要性。
引用
@article{arxiv.2506.21584,
title = {Empirical Evidence for Alignment Faking in a Small LLM and Prompt-Based Mitigation Techniques},
author = {Jeanice Koorndijk},
journal= {arXiv preprint arXiv:2506.21584},
year = {2025}
}
备注
NeurIPS RegML Workshop