中文

人格特征控制显现性错位

机器学习 2025-10-08 v2 人工智能

摘要

理解语言模型如何从训练中泛化到更广泛部署分布中的行为是人工智能安全中的重要问题。Betley 等人发现,对 GPT-4o 进行针对不安全代码的微调会导致“显现性错位”,即模型对无关提示给出典型恶意响应。我们将这项工作扩展到多种条件下,包括在推理模型上进行强化学习、针对各种人造数据集进行微调,以及在无安全训练的模型中。为调查这种广义错位背后的机制,我们应用一种“模型差异”方法,使用稀疏自编码器比较微调前后的内部模型表示。该方法揭示了激活空间中的多个“错位人格”特征,包括一种强烈控制显现性错位的有毒人格特征,可用于预测模型是否表现出此类行为。此外,我们还调查了缓解策略,发现仅用少量良性样本对进行微调即可有效恢复对齐。

关键词

引用

@article{arxiv.2506.19823,
  title  = {Persona Features Control Emergent Misalignment},
  author = {Miles Wang and Tom Dupré la Tour and Olivia Watkins and Alex Makelov and Ryan A. Chi and Samuel Miserendino and Jeffrey Wang and Achyuta Rajaram and Johannes Heidecke and Tejal Patwardhan and Dan Mossing},
  journal= {arXiv preprint arXiv:2506.19823},
  year   = {2025}
}