基于重要性重采样的语言模型数据选择
计算与语言
2023-11-21 v3 机器学习
摘要
选择合适的预训练数据集对于通用领域(如 GPT-3)和特定领域(如 Codex)的语言模型(LMs)都至关重要。我们将此问题形式化为:从大型原始无标签数据集中选择一个子集,以匹配给定无标签目标样本所指定的目标分布。由于原始文本数据的规模和维度很高,现有方法使用简单启发式规则或需要人类专家手动整理数据。相反,我们将低维中使用的经典重要性重采样方法扩展到 LM 数据选择。我们提出了基于重要性重采样的数据选择(DSIR),一个高效且可扩展的框架,该框架在降维特征空间中估计重要性权重以保证可处理性,并根据这些权重通过重要性重采样选择数据。我们使用哈希 n-gram 特征实例化 DSIR 框架以提高效率,从而能够在 4.5 小时内从完整 Pile 数据集中选择 1 亿篇文档。为了衡量哈希 n-gram 特征是否保留了与目标相关的数据方面,我们定义了 KL 缩减(KL reduction),一种在某种特征空间上衡量所选预训练数据与目标之间接近程度的数据度量。在 8 种数据选择方法(包括专家选择)中,哈希 n-gram 特征上的 KL 缩减与平均下游准确率高度相关(r=0.82)。当为特定领域的持续预训练选择数据时,DSIR 在 8 种目标分布上的表现与专家整理相当。当预训练通用领域模型(目标是 Wikipedia 和书籍)时,DSIR 在 GLUE 基准上比随机选择和启发式过滤基线提高 2-2.5%。代码可在 https://github.com/p-lambda/dsir 获取。
引用
@article{arxiv.2302.03169,
title = {Data Selection for Language Models via Importance Resampling},
author = {Sang Michael Xie and Shibani Santurkar and Tengyu Ma and Percy Liang},
journal= {arXiv preprint arXiv:2302.03169},
year = {2023}
}
备注
NeurIPS 2023