TS-Align:面向大型语言模型可扩展迭代微调的教师-学生协同框架
计算与语言
2024-10-01 v4
摘要
主流的大型语言模型(LLM)对齐方法高度依赖人类偏好数据,特别是在模型需要定期更新时。标准的LLM迭代对齐流程涉及为每次更新收集新的人类反馈。然而,这一数据收集过程成本高昂且难以扩展。为此,我们提出“TS-Align”框架,通过自动从模型输出中挖掘成对反馈数据来微调策略模型。这种自动挖掘过程通过大规模教师模型与小规模学生模型的协作高效实现。策略微调过程可在我们提出的教师-学生协同框架内重复进行。通过大量实验,我们展示我们的最终对齐策略在七个对话或指令遵循数据集上相对于基础策略模型平均获胜率达69.7%。此外,我们展示教师的排序能力通过我们的管道有效地蒸馏到学生模型中, resulting in a small-scale yet effective reward model for policy model alignment。
引用
@article{arxiv.2405.20215,
title = {TS-Align: A Teacher-Student Collaborative Framework for Scalable Iterative Finetuning of Large Language Models},
author = {Chen Zhang and Chengguang Tang and Dading Chong and Ke Shi and Guohua Tang and Feng Jiang and Haizhou Li},
journal= {arXiv preprint arXiv:2405.20215},
year = {2024}
}
备注
EMNLP-2024 Findings