中文

深入探究 DeepSeek 模型安全边界:评估与发现

密码学与安全 2025-03-20 v1 人工智能 计算与语言

摘要

本研究对 DeepSeek 模型进行首次全面安全评估,聚焦于评估其生成内容的安全风险。我们的评估涵盖 DeepSeek 最新一代大型语言模型、多模态大型语言模型以及文本到图像模型,系统性地检验其在生成不安全内容方面的表现。值得注意的是,我们构建了一个针对中文社会文化语境的双语(中文-英文)安全评估数据集,更全面地评估了中国研发的模型在安全方面的能力。实验结果表明,尽管 DeepSeek 模型在综合能力方面表现突出,但在多个风险维度(包括算法歧视和色情内容)上仍存在显著的安全漏洞。这些发现为理解和改进大型基础模型的安全性提供了关键见解。我们的代码已公开于 https://github.com/NY1024/DeepSeek-Safety-Eval。

关键词

引用

@article{arxiv.2503.15092,
  title  = {Towards Understanding the Safety Boundaries of DeepSeek Models: Evaluation and Findings},
  author = {Zonghao Ying and Guangyi Zheng and Yongxin Huang and Deyue Zhang and Wenxin Zhang and Quanchen Zou and Aishan Liu and Xianglong Liu and Dacheng Tao},
  journal= {arXiv preprint arXiv:2503.15092},
  year   = {2025}
}