关键学习期:利用早期训练动态进行高效数据剪枝
计算与语言
2024-06-24 v2
摘要
神经机器翻译模型极度依赖数据和计算资源。然而,并非所有数据点都对模型训练和泛化有同等贡献。数据剪枝以去除低价值数据点,可以大幅减少计算预算,而不会显著降低模型性能。在本文中,我们提出了一种新的数据剪枝技术:跨时间检查点(CAT),它利用早期模型训练动态来识别对模型性能最相关的数据点。我们将CAT与包括COMET-QE、LASER和LaBSE在内的几种数据剪枝技术进行了基准测试。我们发现,在多个测试集上,CAT在印欧语系上的表现优于基准方法。当应用于英语-德语、英语-法语和英语-斯瓦希里语翻译任务时,CAT在剪枝高达50%训练数据的情况下,实现了与使用完整数据集相当的性能。我们检查了CAT选择的数据点,发现它倾向于选择较长的句子以及包含独特或罕见词汇的句子。
引用
@article{arxiv.2405.19462,
title = {Critical Learning Periods: Leveraging Early Training Dynamics for Efficient Data Pruning},
author = {Everlyn Asiko Chimoto and Jay Gala and Orevaoghene Ahia and Julia Kreutzer and Bruce A. Bassett and Sara Hooker},
journal= {arXiv preprint arXiv:2405.19462},
year = {2024}
}
备注
Accepted to ACL 2024 Findings