中文

通过集成价值引导实现推理时语言模型对齐

计算与语言 2024-09-27 v1 人工智能

摘要

大型语言模型通常经过微调以与人类偏好对齐,但微调大型模型计算密集且复杂。在这项工作中,我们引入了集成价值引导\textit{集成价值引导}(IVG),一种使用隐式和显式价值函数分别在token级别和块级别指导语言模型解码的方法,纯粹在推理时高效地对齐大型语言模型。这种方法绕过了直接微调的复杂性,并优于传统方法。在实验上,我们展示了IVG在各种任务中的多功能性。在受控情感生成和摘要任务中,我们的方法通过使用基于gpt2\texttt{gpt2}的价值函数进行推理时引导,显著改善了大模型的对齐效果。此外,在更具挑战性的指令遵循基准AlpacaEval 2.0上,我们展示了无论是专门调整的还是现成的价值函数,都极大地提高了大模型相对于gpt-4-turbo\texttt{gpt-4-turbo}的长度控制胜率(例如,使用Tulu引导时,Mistral-7B-Instruct-v0.2\texttt{Mistral-7B-Instruct-v0.2}19.51%19.51\%提升到26.51%26.51\%Mixtral-8x7B-Instruct-v0.1\texttt{Mixtral-8x7B-Instruct-v0.1}25.58%25.58\%提升到33.75%33.75\%)。

关键词

引用

@article{arxiv.2409.17819,
  title  = {Inference-Time Language Model Alignment via Integrated Value Guidance},
  author = {Zhixuan Liu and Zhanhui Zhou and Yuanfu Wang and Chao Yang and Yu Qiao},
  journal= {arXiv preprint arXiv:2409.17819},
  year   = {2024}
}

备注

EMNLP 2024 Findings