Transfer Q*: 用于LLM对齐的原则性解码
计算与语言
2024-06-03 v1 机器学习
摘要
对基础模型进行对齐对于其安全可靠的部署至关重要。然而,传统的微调方法计算密集,需要更新数十亿个模型参数。一个有前景的替代方案是通过解码对齐,该方法直接调整响应分布而无需模型更新,以最大化目标奖励,从而为对齐提供一种轻量且可适应的框架。然而,原则性解码方法依赖于对最优Q函数()的神经式访问,而这在实际中往往不可得。因此,先前的SOTA方法要么使用从参考SFT模型派生的近似该,要么依赖短期奖励,导致解码性能次优。在本工作中,我们提出Transfer ,该方法通过与基线奖励对齐的基线模型(可与目标奖励不同)隐式估计目标奖励的 optimal value函数。Transfer 的理论分析提供了其最优性的严格描述,推导了次优值间隙的上界,并识别了一个用于控制偏离预训练参考SFT模型的超参数。我们的方案显著减少了先前SOTA方法中观察到的次优间隙,并在多个综合和真实数据集上的多个关键指标(如连贯性、多样性和质量)中显示出优异的实证性能。
引用
@article{arxiv.2405.20495,
title = {Transfer Q Star: Principled Decoding for LLM Alignment},
author = {Souradip Chakraborty and Soumya Suvra Ghosal and Ming Yin and Dinesh Manocha and Mengdi Wang and Amrit Singh Bedi and Furong Huang},
journal= {arXiv preprint arXiv:2405.20495},
year = {2024}
}