语言模型的解码时重对齐
机器学习
2024-05-27 v2 人工智能
计算与语言
摘要
将语言模型与人类偏好对齐对于减少这些模型中的错误和偏见至关重要。对齐技术,如基于人类反馈的强化学习(RLHF),通常被表述为优化人类偏好奖励与邻近正则化项之间的权衡,后者鼓励模型保持与未对齐模型接近。选择合适的正则化水平至关重要:正则化不足可能因奖励欺骗而导致模型能力下降,而正则化过度则会阻碍对齐。寻找最佳正则化水平的传统方法需要使用不同的正则化强度重新训练多个模型。然而,这一过程资源密集,尤其是对于大型模型。为应对这一挑战,我们提出了解码时重对齐(DeRa),这是一种简单的方法,无需重新训练即可在对齐模型中探索和评估不同的正则化强度。DeRa 能够控制对齐程度,允许用户在未对齐模型和对齐模型之间平滑过渡。它还通过利用验证数据集识别有效的正则化强度,提高了超参数调优的效率。
引用
@article{arxiv.2402.02992,
title = {Decoding-time Realignment of Language Models},
author = {Tianlin Liu and Shangmin Guo and Leonardo Bianco and Daniele Calandriello and Quentin Berthet and Felipe Llinares and Jessica Hoffmann and Lucas Dixon and Michal Valko and Mathieu Blondel},
journal= {arXiv preprint arXiv:2402.02992},
year = {2024}
}
备注
In Proceedings of the 41st International Conference on Machine Learning (ICML 2024)