LongForm:基于反向指令的高效指令微调
计算与语言
2024-10-04 v3 人工智能
机器学习
摘要
指令微调使语言模型能够更有效地泛化并更好地遵循用户意图。然而,获取指令数据成本高且具挑战性。先前的工作采用了诸如昂贵的人工标注、存在对齐问题的众包数据集,以及通过 LLM 生成带噪声样本等方法。我们引入了通过反向指令创建的 LongForm-C 数据集。我们针对人工撰写的语料样本,利用反向指令通过 LLM 生成指令。首先,我们从 C4 和维基百科等语料中选取一组多样化的人工撰写文档;然后我们通过 LLM 为这些文档生成指令。该方法提供了一种更廉价、更干净的指令微调数据集,其输出自然且适用于长文本生成。我们的模型在故事/食谱生成和长形式问答等任务上优于未经过指令微调的 10 倍规模更大的语言模型。此外,LongForm 模型大幅优于 FLAN-T5 和 Alpaca 等先前的指令微调模型,并进一步提升语言理解能力。我们公开了数据和模型:https://github.com/akoksal/LongForm。
引用
@article{arxiv.2304.08460,
title = {LongForm: Effective Instruction Tuning with Reverse Instructions},
author = {Abdullatif Köksal and Timo Schick and Anna Korhonen and Hinrich Schütze},
journal= {arXiv preprint arXiv:2304.08460},
year = {2024}
}
备注
EMNLP 2024 Findings. This version extends the training with recent LLMs, evaluation with new metrics, and NLU tasks