DisCo:用于半监督文本挖掘的蒸馏学生模型协同训练
计算与语言
2023-10-23 v3
摘要
许多文本挖掘模型通过在下游任务中对大型深度预训练语言模型(PLM)进行微调来构建。然而,当今一个重大挑战是当我们使用带有有限标注样本的轻量模型时如何保持性能。我们提出 DisCo,一种半监督学习(SSL)框架,用于通过知识蒸馏从大型 PLM 生成的一批小型学生模型中进行微调。我们的核心见解是在蒸馏学生群体间共享互补知识以提升其 SSL 有效性。DisCo 采用一种新颖的协同训练技术,通过在多样化视角下促进学生间的知识共享来优化一批多个小型学生模型:由不同蒸馏策略产生的模型视角,以及由各种输入增强产生的数据视角。我们在半监督文本分类和抽取式摘要任务上评估 DisCo。实验结果表明,DisCo 生成的学生模型比基线 PLM 小 7.6 倍、推理快 4.8 倍,同时保持相当性能。我们还表明 DisCo 生成的学生模型优于在不同任务中精心调优的同等规模模型。
引用
@article{arxiv.2305.12074,
title = {DisCo: Distilled Student Models Co-training for Semi-supervised Text Mining},
author = {Weifeng Jiang and Qianren Mao and Chenghua Lin and Jianxin Li and Ting Deng and Weiyi Yang and Zheng Wang},
journal= {arXiv preprint arXiv:2305.12074},
year = {2023}
}