ARGS:作为奖励引导搜索的对齐
计算与语言
2024-02-06 v1 人工智能
机器学习
摘要
将大语言模型与人类目标对齐至关重要,然而包括人类反馈强化学习 (RLHF) 在内的常用方法存在训练不稳定且资源密集的问题。为应对这一挑战,我们引入了 ARGS(Alignment as Reward-Guided Search,作为奖励引导搜索的对齐),这是一种新颖的框架,将对齐整合到解码过程中,消除了对昂贵 RL 训练的需求。通过使用奖励信号调整模型的概率预测,ARGS 生成的文本既具有语义多样性,又符合人类偏好,为对齐语言模型提供了一种有前途且灵活的解决方案。值得注意的是,ARGS 在多样化的对齐任务和各种模型维度上,相较于基线 consistently 展示了平均奖励的提升。例如,在相同的基于贪心的解码策略下,我们的方法相比基线将平均奖励提高了 19.56%,并在 GPT-4 评估中获得了 64.33% 的偏好或平局得分。我们相信,我们强调解码时对齐的框架为未来更具响应性的语言模型铺平了道路。代码公开地址:\url{https://github.com/deeplearning-wisc/args}。
引用
@article{arxiv.2402.01694,
title = {ARGS: Alignment as Reward-Guided Search},
author = {Maxim Khanov and Jirayu Burapacheep and Yixuan Li},
journal= {arXiv preprint arXiv:2402.01694},
year = {2024}
}
备注
ICLR 2024