SteerLM:作为 RLHF 的(用户可操控)替代方案的属性条件化 SFT
计算与语言
2023-10-10 v1 人工智能
机器学习
摘要
以人类偏好对模型进行对齐是使大语言模型 (LLMs) 有用且符合人类价值观的关键步骤。它通常包括监督微调 (SFT) 和基于人类反馈的强化学习 (RLHF) 阶段。然而,RLHF 面临源于复杂训练设置及其倾向于将模型与隐式价值观对齐的固有局限,这些价值观最终用户无法在运行时控制。此外,RLHF 阶段的奖励模型通常依赖于单维反馈,而非指示有用性、幽默度和毒性等属性的显式、多面信号。为应对这些局限,我们提出 SteerLM,一种监督微调方法,赋予最终用户在推理过程中控制回复的能力。SteerLM 使回复符合明确定义的多维属性集合,从而实现一个可操控的 AI,能够生成有用且高质量的回复,同时保持可定制性。实验表明,在开源数据集上训练的 SteerLM 生成的回复被人类和自动评估者偏好于许多用 RLHF 训练的 state-of-the-art 基线,同时训练容易得多。在 https://huggingface.co/nvidia/SteerLM-llama2-13B 试用 SteerLM。
引用
@article{arxiv.2310.05344,
title = {SteerLM: Attribute Conditioned SFT as an (User-Steerable) Alternative to RLHF},
author = {Yi Dong and Zhilin Wang and Makesh Narsimhan Sreedhar and Xianchao Wu and Oleksii Kuchaiev},
journal= {arXiv preprint arXiv:2310.05344},
year = {2023}
}
备注
Findings of EMNLP 2023