语言模型强化微调中的梯度消失现象
机器学习
2024-03-15 v3 人工智能
计算与语言
机器学习
摘要
预训练语言模型通常通过强化微调(RFT)来对齐人类偏好与下游任务,RFT指使用策略梯度算法最大化(可能为学习得到的)奖励函数。本工作指出了RFT中一个根本的优化障碍:我们证明当某输入在模型下的奖励标准差较小时,其期望梯度会消失,即便期望奖励远未达最优。通过在一个RFT基准与受控环境上的实验以及理论分析,我们进一步表明由小奖励标准差引起的梯度消失十分普遍且有害,导致奖励最大化极慢。最后,我们探索克服RFT中梯度消失的方法。我们发现先进行有监督微调(SFT)阶段的常见做法是最有希望的候选方案,这揭示了SFT在RFT流程中的重要性。此外,我们表明仅对少至1%的输入样本进行相对较少步数的SFT优化即可足够,说明初始SFT阶段在计算与数据标注上无需高昂代价。总体而言,我们的结果强调:关注那些以奖励标准差衡量的期望梯度消失的输入,对成功执行RFT至关重要。
引用
@article{arxiv.2310.20703,
title = {Vanishing Gradients in Reinforcement Finetuning of Language Models},
author = {Noam Razin and Hattie Zhou and Omid Saremi and Vimal Thilak and Arwen Bradley and Preetum Nakkiran and Joshua Susskind and Etai Littwin},
journal= {arXiv preprint arXiv:2310.20703},
year = {2024}
}
备注
Accepted to ICLR 2024