弱监督下迭代标签细化比偏好优化更重要
机器学习
2025-01-15 v1 人工智能
计算与语言
摘要
语言模型 (LM) 的后训练依赖于人类监督的两个阶段:用于监督式微调的任务演示,随后是用于强化学习从人类反馈 (RLHF) 的偏好比较。随着 LM 的能力不断提升,所给任务变得更难以监督。在不可靠监督的情况下,后训练是否仍然有效?为检验这一问题,我们使用小型 LM 和受时间限制的人类模拟不可靠的演示和比较反馈。我们发现,在不可靠监督的存在下,SFT 仍保留一定有效性,但 DPO(一种常见的 RLHF 算法)未能在 SFT 之上取得改进。为解决此问题,我们提出了迭代标签细化 (ILR) 作为 RLHF 的替代方案。ILR 通过使用比较反馈决定是否应用人类演示的模型生成备选方案来改进 SFT 数据,然后对更新后的数据进行 SFT retraining。SFT+ILR 在不可靠监督下的多个任务(数学、编码和安全指令跟随)上优于 SFT+DPO。我们的发现表明,随着 LM 被用于复杂任务且人类监督不可靠,RLHF 可能不再是合理的人类比较反馈的最佳用途;相反,将反馈导向改进训练数据而非持续训练模型,才是更好的选择。我们的代码和数据已公开于 https://github.com/helloelwin/iterative-label-refinement。
引用
@article{arxiv.2501.07886,
title = {Iterative Label Refinement Matters More than Preference Optimization under Weak Supervision},
author = {Yaowen Ye and Cassidy Laidlaw and Jacob Steinhardt},
journal= {arXiv preprint arXiv:2501.07886},
year = {2025}
}
备注
22 pages, 10 figures