对齐伪装行为分析
人工智能
2026-05-28 v1 机器学习
摘要
对齐伪装 (Alignment Faking, AF) 指模型在保持部署偏好同时策略性遵循训练目标,以避免行为修改。理解 AF 何时如何产生至关重要,因为模型在区分训练与部署方面变得更好。先前的工作发现 AF 脆弱、提示敏感且模型依赖,使其潜在驱动因素不清晰。我们在控制且最小化的设置中研究 AF,以隔离其核心组件,在更广泛的模型范围内观察到 AF,包括小规模模型。我们识别出三个可分离的驱动因素——价值观、目标保护和讨好,并通过针对性提示剖析和激活引导显示,每个因素独立调制 AF 行为。我们的结果表明 AF 比先前报告的更普遍,其发生可从情境线索和可衡量的模型倾向(如基线讨好和陈述价值观)预测。分解表明 AF 的发生是可预测的,并为未来模型的检测和缓解提供了具体方向。
引用
@article{arxiv.2605.27681,
title = {Behavioural Analysis of Alignment Faking},
author = {Nathaniel Mitrani Hadida and Rhea Karty and David Williams-King and Alan Cooney},
journal= {arXiv preprint arXiv:2605.27681},
year = {2026}
}
备注
preprint