中文

句子级还是词元级?知识蒸馏的全面研究

计算与语言 2024-04-24 v1

摘要

知识蒸馏将知识从教师模型转移到学生模型,已成为神经机器翻译中用于压缩模型或简化训练目标的强大技术。知识蒸馏包含两种主要方法:句子级蒸馏和词元级蒸馏。在句子级蒸馏中,学生模型被训练以与教师模型的输出对齐,这可以缓解训练难度并赋予学生模型对全局结构的全面理解。不同的是,词元级蒸馏要求学生模型学习教师模型的输出分布,促进更细粒度的知识转移。研究表明,在不同场景下句子级和词元级蒸馏表现出不同的性能,导致在知识蒸馏方法的经验选择上产生困惑。在本研究中,我们认为具有更复杂目标(即分布)的词元级蒸馏更适合“简单”场景,而句子级蒸馏在“复杂”场景中表现优异。为了验证我们的假设,我们通过改变学生模型的模型大小、文本复杂度以及解码过程的难度,系统地分析了蒸馏方法的性能。虽然我们的实验结果验证了我们的假设,但定义给定场景的复杂度级别仍然是一项具有挑战性的任务。因此,我们进一步引入了一种新颖的混合方法,该方法通过门控机制结合了词元级和句子级蒸馏,旨在利用两种单一方法的优势。实验表明,该混合方法在性能上大幅超越了词元级或句子级蒸馏方法以及先前的工作,证明了所提出的混合方法的有效性。

关键词

引用

@article{arxiv.2404.14827,
  title  = {Sentence-Level or Token-Level? A Comprehensive Study on Knowledge Distillation},
  author = {Jingxuan Wei and Linzhuang Sun and Yichong Leng and Xu Tan and Bihui Yu and Ruifeng Guo},
  journal= {arXiv preprint arXiv:2404.14827},
  year   = {2024}
}