中文

PKU-SafeRLHF:面向大语言模型多层次安全对齐的人类偏好

人工智能 2025-06-17 v3 计算与语言

摘要

本研究介绍了面向大语言模型(LLM)安全对齐的安全人类偏好数据集PKU-SafeRLHF。作为SafeRLHF和BeaverTails的姊妹项目,我们为问答对提供了有帮助性和无害性的独立标注,提供了这些耦合属性的不同视角。总体而言,我们提供了44.6k个精炼提示和265k个问答对,包含19类损害类别和三个严重程度等级(从轻微到严重),答案由Llama系列模型生成。基于此,我们收集了166.8k条偏好数据,包括双偏好数据(分离有帮助性和无害性)和单偏好数据(从头开始权衡有帮助性和无害性)。使用大规模标注数据,我们进一步训练了严重程度敏感的 moderation 以控制LLM的风险,并开发针对LLM安全对齐的以安全为中心的RLHF算法。我们相信该数据集将为社区提供宝贵资源,助力LLM的安全部署。数据可在https://huggingface.co/datasets/PKU-Alignment/PKU-SafeRLHF获取。

关键词

引用

@article{arxiv.2406.15513,
  title  = {PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference},
  author = {Jiaming Ji and Donghai Hong and Borong Zhang and Boyuan Chen and Juntao Dai and Boren Zheng and Tianyi Qiu and Jiayi Zhou and Kaile Wang and Boxuan Li and Sirui Han and Yike Guo and Yaodong Yang},
  journal= {arXiv preprint arXiv:2406.15513},
  year   = {2025}
}

备注

Accepted by ACL2025 Main, a sibling project to SafeRLHF and BeaverTails