用于语言模型质量提升与压缩的协同训练与协同蒸馏
计算与语言
2023-11-08 v2 人工智能
摘要
知识蒸馏(KD)通过将预训练语言模型(PLM)的知识迁移到更小模型,压缩计算昂贵的 PLM,使其可用于资源受限或实时场景。然而,多数小模型未能超越原始大模型性能,导致以牺牲性能换取推理速度提升。为此,我们提出协同训练与协同蒸馏(CTCD),一种通过协同训练两个模型并相互蒸馏知识,同时提升性能与推理速度的新框架。CTCD 框架基于两项重要发现成功实现该目标:1)协同训练中将小模型知识蒸馏至大模型可提升大模型性能;2)大模型性能增强进一步提振小模型性能。CTCD 框架具前景,因其可结合架构设计或数据增强等现有技术,替代单向 KD 方法,实现进一步性能提升。大量消融研究证明 CTCD 有效性,且 CTCD 蒸馏的小模型在 GLUE 基准上以 1.66 显著优势超越原始大模型。
引用
@article{arxiv.2311.02849,
title = {Co-training and Co-distillation for Quality Improvement and Compression of Language Models},
author = {Hayeon Lee and Rui Hou and Jongpil Kim and Davis Liang and Hongbo Zhang and Sung Ju Hwang and Alexander Min},
journal= {arXiv preprint arXiv:2311.02849},
year = {2023}
}
备注
Findings of EMNLP 2023