别指挥,去培育:系统-2对齐的探索性研究
计算与语言
2025-01-15 v5
摘要
o1系统卡片确定o1模型是OpenAI中最稳健的模型,其定义性特征是从快速、直观的思维过渡到更慢、更周密的推理。这一观察促使我们调查System-2思维模式对模型安全的影响。在我们的初步研究中,我们对o1模型进行了安全评估,包括复杂的越狱攻击场景,使用对抗性自然语言提示和数学编码提示。我们的发现表明,o1模型显示出相对改进的安全性能;然而,它仍然在采用数学编码的越狱攻击方面存在漏洞。通过详细的案例分析,我们识别了o1模型响应的特定模式。我们还探索了使用提示工程和监督微调技术在开源模型上实现System-2安全对齐。实验结果表明,一些简单的方法来鼓励模型仔细审查用户请求对模型安全有益。此外,我们提出了一种用于增强安全对齐的过程监督实施计划。实施细节和实验结果将在后续版本中提供。
引用
@article{arxiv.2411.17075,
title = {Don't Command, Cultivate: An Exploratory Study of System-2 Alignment},
author = {Yuhang Wang and Yuxiang Zhang and Yanxu Zhu and Xinyan Wen and Jitao Sang},
journal= {arXiv preprint arXiv:2411.17075},
year = {2025}
}
备注
In this version, the DPO and reinforcement learning methods have been added