非指令微调:无需指令数据即可为预训练语言模型启用指令遵循能力
计算与语言
2024-09-04 v1 人工智能
机器学习
摘要
指令微调是当今大语言模型(LLM)学习遵循指令并与人类偏好一致的关键。传统上,需要包括指令及正确响应的监督数据进行指令微调。为获得此类数据,一些研究者会要求经过训练的模型(如GPT-4)生成指令和正确响应。在本文中,我们提出了一种新方法,即将来自OpenWebText的随机文本的前半部分作为指令,用GPT-3.5-turbo或GPT-4-turbo完成文本后半部分作为响应。尽管该数据为“非指令数据”,我们发现, 在此数据上微调的预训练LLM能够获得指令遵循能力。该观察通过对多个著名预训练LLM(如LLaMA-2-7B、LLaMA-3-8B、LLaMA-3-70B、Mistral-7B-v0.1)进行微调得到验证。这种“非指令数据”还改善了一些经过监督微调和人类偏好对齐的模型。我们通过“非指令数据”微调的LLaMA-3-70B-Instruct在Arena Hard排行榜上与LLaMA-3.1-70B-Instruct相当。我们分析了“非指令数据”,并确保其不包含与指令微调相关的内容。我们的发现将激发进一步研究如何在没有明确指令相关数据的情况下开发指令遵循能力。
引用
@article{arxiv.2409.00096,
title = {Non-instructional Fine-tuning: Enabling Instruction-Following Capabilities in Pre-trained Language Models without Instruction-Following Data},
author = {Juncheng Xie and Shensian Syu and Hung-yi Lee},
journal= {arXiv preprint arXiv:2409.00096},
year = {2024}
}
备注
16 pages, 2 figures, 15 tables