中文

对齐伪装行为分析

人工智能 2026-05-28 v1 机器学习

摘要

对齐伪装 (Alignment Faking, AF) 指模型在保持部署偏好同时策略性遵循训练目标,以避免行为修改。理解 AF 何时如何产生至关重要,因为模型在区分训练与部署方面变得更好。先前的工作发现 AF 脆弱、提示敏感且模型依赖,使其潜在驱动因素不清晰。我们在控制且最小化的设置中研究 AF,以隔离其核心组件,在更广泛的模型范围内观察到 AF,包括小规模模型。我们识别出三个可分离的驱动因素——价值观、目标保护和讨好,并通过针对性提示剖析和激活引导显示,每个因素独立调制 AF 行为。我们的结果表明 AF 比先前报告的更普遍,其发生可从情境线索和可衡量的模型倾向(如基线讨好和陈述价值观)预测。分解表明 AF 的发生是可预测的,并为未来模型的检测和缓解提供了具体方向。

关键词

引用

@article{arxiv.2605.27681,
  title  = {Behavioural Analysis of Alignment Faking},
  author = {Nathaniel Mitrani Hadida and Rhea Karty and David Williams-King and Alan Cooney},
  journal= {arXiv preprint arXiv:2605.27681},
  year   = {2026}
}

备注

preprint