为跨语言迁移蒸馏高效的语言特定模型
计算与语言
2023-06-05 v1
摘要
大规模多语言 Transformer(MMTs),如 mBERT 和 XLM-R,被广泛用于跨语言迁移学习。尽管这些模型预训练用于表示数百种语言,但 NLP 系统的终端用户通常仅关注个别语言。出于此类目的,MMTs 的语言覆盖使其在模型规模、推理时间、能耗和硬件成本方面的部署代价不必要地高昂。因此我们提出从 MMTs 中提取压缩的、语言特定的模型,其保留原始 MMTs 的跨语言迁移能力。这是通过双语蒸馏 MMT 实现的,即仅使用感兴趣的源语言与目标语言的数据。具体而言,我们采用一种称为 BiStil 的两阶段蒸馏方法:(i)第一阶段从 MMT 蒸馏出通用双语模型,(ii)第二阶段使用原始 MMT 的任务微调变体作为“教师”,对双语“学生”模型进行稀疏微调。我们在若干标准跨语言基准上以零样本跨语言迁移评估了该蒸馏技术。关键结果表明,尽管蒸馏模型显著更小且更快,其目标语言性能相对于基础 MMT 的退化极小。此外,我们发现它们优于 DistilmBERT 和 MiniLMv2 等多语言蒸馏模型,且相比而言训练预算非常有限,即便按每语言计也是如此。我们还展示从 MMTs 蒸馏出的双语模型大幅优于从头训练的双语模型。我们的代码与模型见 https://github.com/AlanAnsell/bistil。
引用
@article{arxiv.2306.01709,
title = {Distilling Efficient Language-Specific Models for Cross-Lingual Transfer},
author = {Alan Ansell and Edoardo Maria Ponti and Anna Korhonen and Ivan Vulić},
journal= {arXiv preprint arXiv:2306.01709},
year = {2023}
}
备注
Accepted to Findings of ACL 2023