中文

Constitutional AI在小型LLM中的有效性:针对DeepSeek-R1及其对手的研究

机器学习 2025-04-14 v2 人工智能 计算机与社会

摘要

近期事件凸显了大型语言模型(LLM)的安全风险,激励对类似Constitutional AI(CAI)等对齐方法的研究。本文探讨了CAI自我批判机制在小型、未过滤的7-9B参数模型上的应用,包括DeepSeek-R1-8B、Gemma-2-9B、Llama 3.1-8B和Qwen2.5-7B。我们表明,尽管基于Llama的模型通过自我批判实现了显著的伤害减少,但其他架构在伤害检测方面的改进效果较小。这些结果表明,CAI的有效性可能取决于模型架构和推理能力。

关键词

引用

@article{arxiv.2503.17365,
  title  = {How Effective Is Constitutional AI in Small LLMs? A Study on DeepSeek-R1 and Its Peers},
  author = {Antonio-Gabriel Chacón Menke and Phan Xuan Tan},
  journal= {arXiv preprint arXiv:2503.17365},
  year   = {2025}
}