DeepSeek的阴暗面:针对启用思维链模型安全对齐的微调攻击
密码学与安全
2025-02-04 v1 人工智能
摘要
大型语言模型通常在预训练阶段基于海量数据进行训练,其中可能包含一些潜在的有害信息。微调攻击可以利用这一点,通过提示模型来揭示此类行为,从而导致有害内容的生成。本文重点研究基于思维链的推理模型DeepSeek在遭受微调攻击时的表现。具体而言,我们探索了微调如何操纵模型的输出,加剧其响应的有害性,同时考察思维链推理与对抗性输入之间的相互作用。通过这项研究,我们旨在揭示启用思维链的模型对微调攻击的脆弱性,及其对模型安全和伦理部署的影响。
引用
@article{arxiv.2502.01225,
title = {The dark deep side of DeepSeek: Fine-tuning attacks against the safety alignment of CoT-enabled models},
author = {Zhiyuan Xu and Joseph Gardiner and Sana Belguith},
journal= {arXiv preprint arXiv:2502.01225},
year = {2025}
}
备注
12 Pages