中文

课程纠正:使用合成偏好进行安全对齐

计算与语言 2024-10-29 v2 人工智能 机器学习

摘要

大型语言模型(LLM)生成有害内容的风险成为关键关注议题。本文系统性地研究了评估和改进LLM执行"课程纠正"任务的能力,即模型能够自主地偏离生成有害内容。首先,我们引入了\textsc{C2^2-Eval}基准进行定量评估,并分析了10个流行的LLM,揭示了当前安全调优LLM在课程纠正方面的不同熟练程度。为改进,我们提出了使用偏好学习进行微调的方案,强调及时进行课程纠正的偏好。在自动化管道中,我们创建了\textsc{C2^2-Syn}数据集,包含75万对偏好,通过数据驱动的偏好学习教授模型及时课程纠正确的概念。对2个LLM(\textsc{Llama2-Chat 7B}和\textsc{Qwen2 7B})的实验表明,我们的方法有效提升了课程纠正技能,同时不影响一般性能。此外,它有效提高了LLM的安全性,尤其是在抵抗越狱攻击方面。

关键词

引用

@article{arxiv.2407.16637,
  title  = {Course-Correction: Safety Alignment Using Synthetic Preferences},
  author = {Rongwu Xu and Yishuo Cai and Zhenhong Zhou and Renjie Gu and Haiqin Weng and Yan Liu and Tianwei Zhang and Wei Xu and Han Qiu},
  journal= {arXiv preprint arXiv:2407.16637},
  year   = {2024}
}

备注

Paper accepted to EMNLP 2024. Camera-ready version. We have released our dataset and scripts at https://github.com/pillowsofwind/Course-Correction