中文

SHED:基于 Shapley 值的指令微调自动数据集精炼

计算与语言 2024-10-31 v2 机器学习

摘要

预训练的大型语言模型(LLMs)可以通过微调适应许多下游任务,并经过定制以符合人类偏好。最近的研究发现,LLMs 仅需少量高质量数据即可达到理想的性能,这表明这些庞大数据集中的大量数据是冗余的甚至是有害的。从海量数据集中识别高质量数据,以构建小而有效的数据集,已成为一项关键挑战。在本文中,我们介绍了 SHED,一个基于 Shapley 值的指令微调自动数据集精炼框架。SHED 无需人工干预或使用商业 LLMs。此外,通过 SHED 构建的数据集展现出可迁移性,表明它们可以在不同的 LLMs 中重复使用,并保持一致的高性能。我们进行了广泛的实验来评估 SHED 构建的数据集。结果表明,SHED 在各种任务和 LLMs 上均优于 SOTA 方法;值得注意的是,仅包含由 SHED 选择的原始数据 10% 的数据集,其性能即可媲美或超越完整数据集。

关键词

引用

@article{arxiv.2405.00705,
  title  = {SHED: Shapley-Based Automated Dataset Refinement for Instruction Fine-Tuning},
  author = {Yexiao He and Ziyao Wang and Zheyu Shen and Guoheng Sun and Yucong Dai and Yongkai Wu and Hongyi Wang and Ang Li},
  journal= {arXiv preprint arXiv:2405.00705},
  year   = {2024}
}

备注

NeurIPS 2024