BeaverTails:通过人类偏好数据集改进大语言模型安全对齐
计算与语言
2023-11-08 v3
摘要
在本文中,我们介绍了 BeaverTails 数据集,旨在促进大语言模型(LLMs)安全对齐的研究。该数据集独特地将问答对的有用性和无害性标注分离,从而就这些关键属性提供了不同的视角。我们总共收集了 333,963 个问答(QA)对的安全元标签,以及 361,903 对针对有用性和无害性指标的专家比较数据。我们进一步展示了 BeaverTails 在内容审核和基于人类反馈的强化学习(RLHF)中的应用,强调其在 LLM 实际安全措施方面的潜力。我们相信该数据集为社区提供了重要资源,有助于 LLM 的安全开发与部署。我们的项目页面位于以下 URL:https://sites.google.com/view/pku-beavertails。
引用
@article{arxiv.2307.04657,
title = {BeaverTails: Towards Improved Safety Alignment of LLM via a Human-Preference Dataset},
author = {Jiaming Ji and Mickel Liu and Juntao Dai and Xuehai Pan and Chi Zhang and Ce Bian and Chi Zhang and Ruiyang Sun and Yizhou Wang and Yaodong Yang},
journal= {arXiv preprint arXiv:2307.04657},
year = {2023}
}
备注
Published at NeurIPS 2023