通过强化学习对冻结大语言模型进行对齐:迭代重加权-优化方法
机器学习
2025-07-04 v2 人工智能
计算与语言
摘要
与人类偏好对齐大语言模型(LLM)通常需要RLHF和DPO等微调方法。这些方法直接优化模型参数,因而无法用于测试时提高模型性能,也不适用于模型权重不可访问的情况。相比之下,测试时方法通过利用奖励函数指导和改进输出质量,规避了权重更新。然而,这些方法计算成本高昂,且往往基于不完美的奖励或价值函数进行单次指导,导致输出次优。本文提出一种名为Iterative Reweight-then-Optimize(IRO)的方法,一种强化学习(RL)框架,用于在不修改参数的情况下对(冻结的)基础模型进行RL风格的对齐。在训练期间,每一次迭代(i)从基础模型中抽样候选解,(ii)使用当前价值函数重新抽样,(iii)训练新的轻量级价值函数以指导下一轮解码。测试时,使用价值函数通过基于搜索的优化过程指导基础模型生成。值得注意的是,用户可以像OpenAI的强化微调(RFT)一样在自有数据集上对模型进行对齐,但无需获取模型权重。
引用
@article{arxiv.2506.17828,
title = {Aligning Frozen LLMs by Reinforcement Learning: An Iterative Reweight-then-Optimize Approach},
author = {Xinnan Zhang and Chenliang Li and Siliang Zeng and Jiaxiang Li and Zhongruo Wang and Kaixiang Lin and Songtao Lu and Alfredo Garcia and Mingyi Hong},
journal= {arXiv preprint arXiv:2506.17828},
year = {2025}
}