面向高效语言数据采样的规模化影响分数
机器学习
2023-11-29 v1 计算与语言
摘要
现代机器学习系统摄取来自不同来源聚合的数据,例如合成数据、人工标注数据和实时客户流量。理解哪些样本对学习算法性能重要,对于高效模型训练至关重要。近来,越来越多的文献提出了各种“影响分数”,利用模型置信度或检查点梯度等训练产物来识别重要数据子集。然而,这些方法主要在计算机视觉场景中发展,尚不清楚它们在基于语言的预训练模型任务上泛化效果如何。本文中,我们探索影响分数在语言分类任务中的适用性。我们在 SNLI 数据集上通过量化随机与基于影响分数的采样剪枝训练数据所引起的准确率变化,评估了这些分数中的多样化子集。随后,我们在暴露于语音助手类动态用户语音模式的 NLU 模型栈中,对其中一种分数——Agarwal 等人(2022)提出的“梯度方差”(VoG)——进行了压力测试。我们的实验表明,在许多情况下,基于编码器的语言模型可在约 50% 原始数据上微调而不损失性能指标。在此过程中,我们总结了应用开箱即用影响分数实现的经验教训,量化了噪声与类别不平衡数据的影响,并给出了基于分数的采样在准确率和训练效率方面的建议。
引用
@article{arxiv.2311.16298,
title = {Influence Scores at Scale for Efficient Language Data Sampling},
author = {Nikhil Anand and Joshua Tan and Maria Minakova},
journal= {arXiv preprint arXiv:2311.16298},
year = {2023}
}
备注
Accepted at EMNLP '23