用于更好微调预训练模型的动态纠正自蒸馏方法
计算与语言
2023-12-13 v1 人工智能
摘要
我们解决了在标记下游数据有限的情况下,预训练语言模型(PLMs)迁移学习过程中遇到的过度微调这一挑战性问题。该问题主要导致后续任务上的性能下降。受传统机器学习中自适应提升方法的启发,我们提出了一种有效的动态纠正自蒸馏(DCS)方法来改进 PLMs 的微调。我们的技术涉及执行一种自蒸馏机制,其中在每次迭代中,学生模型通过动态调整分配给各个数据点的权重来主动适应并纠正自身。这种迭代式的自我纠正过程显著增强了 PLMs 的整体微调能力,从而提高了性能和鲁棒性。我们使用 GLUE 基准进行了全面评估,证明了我们的方法在增强各种 PLMs 在不同下游任务中的微调过程方面的有效性。
引用
@article{arxiv.2312.07028,
title = {Dynamic Corrective Self-Distillation for Better Fine-Tuning of Pretrained Models},
author = {Ibtihel Amara and Vinija Jain and Aman Chadha},
journal= {arXiv preprint arXiv:2312.07028},
year = {2023}
}