中文

DeepSeek的阴暗面:针对启用思维链模型安全对齐的微调攻击

密码学与安全 2025-02-04 v1 人工智能

摘要

大型语言模型通常在预训练阶段基于海量数据进行训练,其中可能包含一些潜在的有害信息。微调攻击可以利用这一点,通过提示模型来揭示此类行为,从而导致有害内容的生成。本文重点研究基于思维链的推理模型DeepSeek在遭受微调攻击时的表现。具体而言,我们探索了微调如何操纵模型的输出,加剧其响应的有害性,同时考察思维链推理与对抗性输入之间的相互作用。通过这项研究,我们旨在揭示启用思维链的模型对微调攻击的脆弱性,及其对模型安全和伦理部署的影响。

关键词

引用

@article{arxiv.2502.01225,
  title  = {The dark deep side of DeepSeek: Fine-tuning attacks against the safety alignment of CoT-enabled models},
  author = {Zhiyuan Xu and Joseph Gardiner and Sana Belguith},
  journal= {arXiv preprint arXiv:2502.01225},
  year   = {2025}
}

备注

12 Pages