平衡增强、无害性与通用能力:通过直接RLHF增强对话大语言模型
计算与语言
2024-03-06 v1
摘要
在对话大语言模型(LLM)的最新进展中,出现了一个令人担忧的趋势,即许多新的基础LLM在监督微调(SFT)后,其基础能力出现了知识缩减。这个过程常常导致遗忘或基础模型能力下降。此外,微调模型难以与用户偏好对齐,在特定提示下会无意中增加有毒输出的生成。为了克服这些挑战,我们采用了一种创新方法,完全绕过SFT,直接实施无害强化学习从人类反馈(RLHF)。我们的方法不仅保留了基础模型的通用能力,还显著增强了其对话能力,同时显著减少了有毒输出的生成。我们的方法对需要细致理解和生成响应的领域(如客户服务)具有重要意义。我们将此方法应用于最流行的基础模型Mistral,从而创建了Mistral-Plus。我们在11个通用任务上的验证表明,Mistral-Plus优于类似规模的开源基础模型及其对应的指令版本。重要的是,Mistral-Plus的对话能力得到了显著提升,表明在安全性和用户偏好对齐方面,它比传统的SFT模型有了实质性进步。
引用
@article{arxiv.2403.02513,
title = {Balancing Enhancement, Harmlessness, and General Capabilities: Enhancing Conversational LLMs with Direct RLHF},
author = {Chen Zheng and Ke Sun and Hang Wu and Chenguang Xi and Xun Zhou},
journal= {arXiv preprint arXiv:2403.02513},
year = {2024}
}