利用合成偏好数据对语言模型进行可配置安全微调
计算与语言
2024-04-02 v1 人工智能
摘要
最先进的语言模型微调技术(如直接偏好优化(DPO))通过将预定义行为硬编码到模型中,限制了用户的控制能力。为了解决这一问题,我们提出了一种新方法——可配置安全微调(CST),该方法利用合成偏好数据增强 DPO,以在推理时实现 LLM 的灵活安全配置。CST 通过引入指定安全配置的系统提示词,克服了原始 DPO 的限制,使 LLM 部署者能够根据自身需要禁用/启用安全偏好,只需更改系统提示词即可。我们的实验评估表明,CST 成功管理了不同的安全配置并保留了 LLM 的原有功能,表明它是一种用于可配置部署的稳健方法。数据和模型可在 https://github.com/vicgalle/configurable-safety-tuning 获取
引用
@article{arxiv.2404.00495,
title = {Configurable Safety Tuning of Language Models with Synthetic Preference Data},
author = {Victor Gallego},
journal= {arXiv preprint arXiv:2404.00495},
year = {2024}
}