Bi-Drop:通过同步子网络估计与优化增强微调泛化性
计算与语言
2023-10-24 v2
摘要
预训练语言模型在自然语言理解中取得显著成功。然而,在有限训练数据上微调预训练模型易过拟合从而削弱性能。本文提出 Bi-Drop,一种利用 dropout 动态生成的多路子网络梯度选择性更新模型参数的微调策略。Bi-Drop 的子网络估计以批内方式进行,从而克服先前异步子网络估计方法的更新滞后问题。此外,Bi-Drop 仅需一个 mini-batch 估计子网络,因而实现更高的训练数据利用率。在 GLUE 基准上的实验表明 Bi-Drop 持续优于先前微调方法。进一步实证结果亦显示 Bi-Drop 在领域迁移、数据不平衡与低资源场景下展现出优异的泛化能力与鲁棒性。
引用
@article{arxiv.2305.14760,
title = {Bi-Drop: Enhancing Fine-tuning Generalization via Synchronous sub-net Estimation and Optimization},
author = {Shoujie Tong and Heming Xia and Damai Dai and Runxin Xu and Tianyu Liu and Binghuai Lin and Yunbo Cao and Zhifang Sui},
journal= {arXiv preprint arXiv:2305.14760},
year = {2023}
}
备注
EMNLP 2023 Findings. Camera-ready version. Co-first authors with equal contributions