数据节食下的自然语言理解:面向 NLP 分类任务的动态数据子集选择
计算与语言
2023-06-07 v1 人工智能
摘要
微调大语言模型抬高了 NLU 应用的成本,且仍是开发周期的瓶颈。计算机视觉近期工作使用数据剪枝以减少训练时间。基于静态方法的剪枝数据选择,依赖于在微调前为每个训练样本计算一个分数,这涉及重要的计算开销。此外,该分数未必能代表整个训练周期内样本的重要性。我们提出以动态数据剪枝的精炼版本解决这些问题,即一种在微调过程中周期性地对不重要样本评分并丢弃的课程策略。我们的方法利用了 EL2N 度量,将其扩展至联合意图与槽位分类任务,以及在全训练集上的初始微调阶段。我们在 GLUE 基准和四个联合 NLU 数据集上的结果表明,与静态方法相比具有更好的时间-精度权衡。我们的方法在 50% 数据点上训练时保持完全精度,并将计算时间减少多达 41%。如果我们转而容忍 1% 的微小精度下降,则可剪枝 80% 的训练样本,使微调时间减少达 66%。
引用
@article{arxiv.2306.03208,
title = {NLU on Data Diets: Dynamic Data Subset Selection for NLP Classification Tasks},
author = {Jean-Michel Attendu and Jean-Philippe Corbeil},
journal= {arXiv preprint arXiv:2306.03208},
year = {2023}
}