基于迁移 Shapley 值的大语言模型微调数据选择
计算与语言
2023-06-21 v1
摘要
尽管 Shapley 值已被证明在识别有害训练样本方面极为有效,但数据集规模与模型复杂度的限制制约了将基于 Shapley 的数据估值应用于大预训练语言模型微调的能力。为此,我们提出 TS-DShapley,一种通过以下方式降低基于 Shapley 的数据估值计算成本的算法:1) 一种高效的基于采样的方法,聚合从子集计算的 Shapley 值以对整体训练集进行估值;2) 一种价值迁移方法,利用从使用目标语言模型表征训练的简单分类器中提取的价值信息。我们将 TS-DShapley 应用于基准自然语言理解(NLU)数据集上 BERT 类语言模型微调的数据选择实验表明,TS-DShapley 优于现有数据选择方法。此外,TS-DShapley 可筛选微调数据,相比使用完整微调数据集训练提升语言模型性能。
引用
@article{arxiv.2306.10165,
title = {Data Selection for Fine-tuning Large Language Models Using Transferred Shapley Values},
author = {Stephanie Schoch and Ritwick Mishra and Yangfeng Ji},
journal= {arXiv preprint arXiv:2306.10165},
year = {2023}
}
备注
Accepted to ACL SRW 2023