论数据筛选与微调在领域自适应中的互补性
计算与语言
2021-09-17 v1 机器学习
摘要
神经网络的领域自适应通常依赖于三个训练阶段:预训练、筛选数据训练以及随后的微调。数据筛选通过利用一小部分目标领域数据所识别出的预训练数据进一步训练,从而改善目标领域的泛化能力。本工作考察了数据筛选在语言建模和机器翻译中的益处。我们的实验评估了筛选与微调的互补性,并得出了实用建议:(i) 筛选数据必须与微调领域相似,但不应过于相似以至于削弱微调的互补效应;(ii) 在选取少量数据以快速但有限的进展,或选取大量数据以缓慢但持久的进展之间存在权衡;(iii) 数据筛选可在预训练早期应用,其性能提升可与长时间预训练相当;(iv) 基于领域分类器的数据筛选通常比流行的对比数据筛选方法更有效。
引用
@article{arxiv.2109.07591,
title = {On the Complementarity of Data Selection and Fine Tuning for Domain Adaptation},
author = {Dan Iter and David Grangier},
journal= {arXiv preprint arXiv:2109.07591},
year = {2021}
}