中文

改进 BERT 模型的知识蒸馏:损失函数、映射方法与权重调优

计算与语言 2023-08-29 v1 人工智能

摘要

基于大型 transformer 的模型(如 BERT、GPT 和 T5)的使用已带来自然语言处理的显著进步。然而,这些模型计算代价高昂,亟需能够在保持准确率的同时降低其规模与复杂度的模型压缩技术。本项目研究并应用知识蒸馏用于 BERT 模型压缩,特别关注 TinyBERT 学生模型。我们探索多种改进知识蒸馏的技术,包括损失函数实验、transformer 层映射方法,以及调优注意力损失与表示损失的权重,并在 GLUE 基准的若干下游任务上评估我们所提出的技术。本工作的目标是提升知识蒸馏的效率与有效性,从而支撑开发面向一系列自然语言处理任务的更高效且更准确的模型。

关键词

引用

@article{arxiv.2308.13958,
  title  = {Improving Knowledge Distillation for BERT Models: Loss Functions, Mapping Methods, and Weight Tuning},
  author = {Apoorv Dankar and Adeem Jassani and Kartikaeya Kumar},
  journal= {arXiv preprint arXiv:2308.13958},
  year   = {2023}
}