指令挖掘:用于大语言模型微调的指令数据筛选
计算与语言
2024-07-30 v3 人工智能
机器学习
摘要
大语言模型(LLMs)最初经过预训练以获得广泛能力,随后使用指令遵循数据集进行微调,以提升其与人类交互的表现。尽管微调技术不断进步,但用于筛选高质量数据集以优化该过程的标准化指南仍付之阙如。在本文中,我们首先提出 InstructMining,一种专为自动筛选优质指令遵循数据以微调 LLM 而设计的创新方法。具体而言,InstructMining 利用自然语言指标作为数据质量的度量,将其应用于评估未见过的数据集。在实验中,我们发现大语言模型微调中存在双下降现象。基于该观察,我们进一步利用 BlendSearch 来帮助在完整数据集中找到最佳子集(即 100,000 条中的 2,532 条)。实验结果表明,InstructMining-7B 在两个最流行的基准测试 LLM-as-a-judge 和 Huggingface OpenLLM leaderboard 上取得了最先进的性能。
引用
@article{arxiv.2307.06290,
title = {Instruction Mining: Instruction Data Selection for Tuning Large Language Models},
author = {Yihan Cao and Yanbin Kang and Chi Wang and Lichao Sun},
journal= {arXiv preprint arXiv:2307.06290},
year = {2024}
}
备注
24 pages, 7 figures