Safer-Instruct:以自动化偏好数据对齐语言模型
计算与语言
2024-04-02 v3 人工智能
摘要
基于人类反馈的强化学习(RLHF)是提升语言模型能力的重要策略。然而,为 RLHF 标注偏好数据是一个资源密集且需要创造力的过程,而现有的自动生成方法在数据多样性与质量方面存在局限。为此,我们提出 Safer-Instruct,一种用于自动构建大规模偏好数据的新颖流水线。我们的方法利用反向指令微调、指令归纳与专家模型评估,在无人工标注的情况下高效生成高质量偏好数据。为验证 Safer-Instruct 的有效性,我们应用该流水线构建了一个安全偏好数据集作为案例研究。在該合成数据集上微调 Alpaca 模型,不仅展现出更好的无害性,且优于在人类标注的安全偏好数据上微调的模型,同时在下游任务中保持竞争力。重要的是,我们的 Safer-Instruct 框架具有通用性,可应用于跨领域的偏好数据生成,其效用超越安全偏好。它解决了偏好数据获取中的挑战,并推动了更强大且负责任的 AI 系统的发展。数据集与代码实现见 https://github.com/uscnlp-lime/safer-instruct
引用
@article{arxiv.2311.08685,
title = {Safer-Instruct: Aligning Language Models with Automated Preference Data},
author = {Taiwei Shi and Kai Chen and Jieyu Zhao},
journal= {arXiv preprint arXiv:2311.08685},
year = {2024}
}
备注
16 pages. NAACL 2024 Camera-ready