中文

用于语言模型质量提升与压缩的协同训练与协同蒸馏

计算与语言 2023-11-08 v2 人工智能

摘要

知识蒸馏(KD)通过将预训练语言模型(PLM)的知识迁移到更小模型,压缩计算昂贵的 PLM,使其可用于资源受限或实时场景。然而,多数小模型未能超越原始大模型性能,导致以牺牲性能换取推理速度提升。为此,我们提出协同训练与协同蒸馏(CTCD),一种通过协同训练两个模型并相互蒸馏知识,同时提升性能与推理速度的新框架。CTCD 框架基于两项重要发现成功实现该目标:1)协同训练中将小模型知识蒸馏至大模型可提升大模型性能;2)大模型性能增强进一步提振小模型性能。CTCD 框架具前景,因其可结合架构设计或数据增强等现有技术,替代单向 KD 方法,实现进一步性能提升。大量消融研究证明 CTCD 有效性,且 CTCD 蒸馏的小模型在 GLUE 基准上以 1.66 显著优势超越原始大模型。

关键词

引用

@article{arxiv.2311.02849,
  title  = {Co-training and Co-distillation for Quality Improvement and Compression of Language Models},
  author = {Hayeon Lee and Rui Hou and Jongpil Kim and Davis Liang and Hongbo Zhang and Sung Ju Hwang and Alexander Min},
  journal= {arXiv preprint arXiv:2311.02849},
  year   = {2023}
}

备注

Findings of EMNLP 2023