中文

DeepSeek模型在中文语境下的安全评估与增强

计算与语言 2025-05-19 v2 人工智能 计算机与社会

摘要

DeepSeek-R1以其卓越的推理能力和开源策略,正在显著影响全球人工智能格局。然而,它表现出显著的安全缺陷。Robust Intelligence(Cisco子公司)与宾夕法尼亚大学合作进行的近期研究揭示,DeepSeek-R1在处理有害提示时达到100%的攻击成功率。此外,多个安全公司和研究机构已识别出该模型中的关键安全漏洞。尽管中国联通已发现R1在中文语境下的安全漏洞,但R1系列中其余蒸馏模型的安全能力尚未得到全面评估。为填补这一空白,本研究利用全面的中文安全基准CHiSafetyBench对DeepSeek-R1系列蒸馏模型进行深入安全评估。旨在评估这些模型在蒸馏前后在中文语境下的安全能力,并进一步阐明蒸馏对模型安全的不利影响。基于这些发现,我们为整个DeepSeek-R1模型系列实施了针对性的安全增强。评估结果表明,增强后的模型在安全方面取得了显著提升,同时在推理能力上没有明显退化。我们已在https://github.com/UnicomAI/DeepSeek-R1-Safe开源安全增强模型,作为未来研究和优化DeepSeek模型的宝贵资源。

关键词

引用

@article{arxiv.2503.16529,
  title  = {Safety Evaluation and Enhancement of DeepSeek Models in Chinese Contexts},
  author = {Wenjing Zhang and Xuejiao Lei and Zhaoxiang Liu and Limin Han and Jiaojiao Zhao and Junting Guo and Zhenhong Long and Shu Yang and Meijuan An and Beibei Huang and Rongjia Du and Ning Wang and Kai Wang and Shiguo Lian},
  journal= {arXiv preprint arXiv:2503.16529},
  year   = {2025}
}

备注

21 pages, 13 figures, 4 tables