R1dacted:调查 DeepSeek R1 语言模型中的局部审查
计算与语言
2025-05-20 v1 密码学与安全
机器学习
摘要
DeepSeek recently 发布了 R1,一款针对推理任务优化的高性能大型语言模型 (LLM)。尽管其训练管道高效,R1 在多个基准测试上实现了竞争甚至领先于 OpenAI 的 o1 等领先推理模型的性能。然而,近期报告表明,R1 在涉及中国敏感话题的查询时会拒绝作答。虽然现有 LLM 通常实施措施以避免生成有害或冒犯的输出,但 R1 代表了一种显著的转变——在政治敏感查询方面表现出类似审查的行为。在本文中,我们通过引入大规模精选提示语集合来调查这一现象,这些提示语被 R1 审查覆盖,但其他模型不予审查。我们随后全面分析了 R1 的审查模式,检讨其一致性、触发器以及在不同话题、提示语措辞和上下文中的变化。除英文查询外,我们还探讨了其他语言中的审查行为。我们还调查了从 R1 语言模型蒸馏的模型的审查可转移性。最后,我们提出了绕过或移除此审查的技术。我们的发现表明,可能存在额外的审查集成,这些集成很可能受训练或对齐期间设计选择的影响,引发关于语言模型部署透明度、偏见和治理的担忧。
引用
@article{arxiv.2505.12625,
title = {R1dacted: Investigating Local Censorship in DeepSeek's R1 Language Model},
author = {Ali Naseh and Harsh Chaudhari and Jaechul Roh and Mingshi Wu and Alina Oprea and Amir Houmansadr},
journal= {arXiv preprint arXiv:2505.12625},
year = {2025}
}