CAMeMBERT:级联助手中介多语言 BERT
计算与语言
2022-12-23 v1
摘要
具有数亿乃至数十亿参数的大语言模型在多种自然语言处理(NLP)任务上表现极佳。然而,其广泛应用与采纳受限于足够大的计算资源的可获得性与可移植性不足。本文提出一种知识蒸馏(KD)技术,建立在 LightMBERT(多语言 BERT(mBERT)的学生模型)的工作之上。通过经由日益压缩的顶层蒸馏教师助手网络对 mBERT 进行反复蒸馏,CAMeMBERT 旨在改善 mBERT 的时间与空间复杂度,同时将精度损失保持在可接受阈值内。目前,CAMeMBERT 平均精度约为 60.1%,在今后微调所用超参数改进后此值会有变动。
引用
@article{arxiv.2212.11456,
title = {CAMeMBERT: Cascading Assistant-Mediated Multilingual BERT},
author = {Dan DeGenaro and Jugal Kalita},
journal= {arXiv preprint arXiv:2212.11456},
year = {2022}
}
备注
4 pages, 2 figures, 3 tables