RAIN:无需微调,你的语言模型可自行对齐
计算与语言
2023-10-10 v2
摘要
大语言模型(LLMs)常表现出与人类偏好不一致的情况。先前研究通常收集人类偏好数据,随后通过强化学习或指令微调(即微调步骤)对齐预训练模型。相比之下,无需对齐数据而对冻结的 LLM 进行对齐更具吸引力。本工作探索了后一设定的潜力。我们发现通过整合自评估与回退机制,未对齐的 LLM 可通过自我提升直接产生符合人类偏好的回复。我们引入一种新颖的推断方法,可回退自回归推断(Rewindable Auto-regressive INference, RAIN),使预训练 LLM 能评估自身生成并利用评估结果引导回退与生成以实现 AI 安全。值得注意的是,RAIN 无需额外对齐数据,且不使用任何训练、梯度计算或参数更新。由 GPT-4 与人类评估的实验结果展示了 RAIN 的有效性:在 HH 数据集上,RAIN 将 LLaMA 30B 的无害率从原始推断的 82% 提升至 97%,同时保持有用性率。在 TruthfulQA 数据集上,RAIN 将已良好对齐的 LLaMA-2-chat 13B 模型的真实性提升了 5%。
引用
@article{arxiv.2309.07124,
title = {RAIN: Your Language Models Can Align Themselves without Finetuning},
author = {Yuhui Li and Fangyun Wei and Jinjing Zhao and Chao Zhang and Hongyang Zhang},
journal= {arXiv preprint arXiv:2309.07124},
year = {2023}
}