Constitutional AI在小型LLM中的有效性:针对DeepSeek-R1及其对手的研究
机器学习
2025-04-14 v2 人工智能
计算机与社会
摘要
近期事件凸显了大型语言模型(LLM)的安全风险,激励对类似Constitutional AI(CAI)等对齐方法的研究。本文探讨了CAI自我批判机制在小型、未过滤的7-9B参数模型上的应用,包括DeepSeek-R1-8B、Gemma-2-9B、Llama 3.1-8B和Qwen2.5-7B。我们表明,尽管基于Llama的模型通过自我批判实现了显著的伤害减少,但其他架构在伤害检测方面的改进效果较小。这些结果表明,CAI的有效性可能取决于模型架构和推理能力。
引用
@article{arxiv.2503.17365,
title = {How Effective Is Constitutional AI in Small LLMs? A Study on DeepSeek-R1 and Its Peers},
author = {Antonio-Gabriel Chacón Menke and Phan Xuan Tan},
journal= {arXiv preprint arXiv:2503.17365},
year = {2025}
}