Tuna:利用大语言模型反馈进行指令微调
计算与语言
2023-10-23 v1 机器学习
摘要
使用来自更强大大语言模型(LLM)如 Instruct-GPT 和 GPT-4 的直接输出,对 LLaMA 等开源大语言模型(LLM)进行指令微调,已被证明是一种使模型行为与人类偏好对齐的具有成本效益的方法。然而,经指令微调的模型对每条指令仅见过一个响应,缺乏关于潜在更优响应的知识。在本文中,我们提出使用新颖的\textit{概率排序}(probabilistic ranking)与\textit{上下文排序}(contextual ranking)方法对指令微调后的 LLM 进行微调,以增加生成更优响应的可能性。概率排序使指令微调模型能够从教师 LLM 继承高质量与低质量响应的相对排序。另一方面,利用上下文排序进行学习可使模型借助更强 LLM 的上下文理解能力精炼自身的响应分布。此外,我们将概率排序与上下文排序依次应用于指令微调后的 LLM。由此得到的模型,我们称之为\textbf{Tuna},在 Super Natural Instructions(119 个测试任务)、LMentry(25 个测试任务)、Vicuna QA 上持续提升性能,甚至能取得优于若干强强化学习基线的结果。我们的代码与数据可在 \url{ https://github.com/microsoft/LMOps} 获取。
引用
@article{arxiv.2310.13385,
title = {Tuna: Instruction Tuning using Feedback from Large Language Models},
author = {Haoran Li and Yiran Liu and Xingxing Zhang and Wei Lu and Furu Wei},
journal= {arXiv preprint arXiv:2310.13385},
year = {2023}
}
备注
EMNLP 2023, code and data are available at https://github.com/microsoft/LMOps