WaLDORf:面向阅读理解的无浪费语言模型蒸馏
机器学习
2020-02-20 v2 计算与语言
摘要
基于 Transformer 的超大型语言模型(VLLM),如 BERT、XLNet 和 RoBERTa,近来在大量自然语言理解(NLU)任务上展现出卓越性能。然而,由于其规模,这些 VLLM 极其消耗资源,且在生产环境部署时十分笨重。近期的若干文献探讨了将基于 transformer 的 VLLM(最常见为 BERT-Base)中的知识以多种方式蒸馏到更小的模型,从而在推理时大幅加速。在此,我们提出一组新技术,共同产生一个任务特定的卷积与 transformer 混合模型 WaLDORf,其在实现 SOTA 推理速度的同时,仍比此前的蒸馏模型更准确。
引用
@article{arxiv.1912.06638,
title = {WaLDORf: Wasteless Language-model Distillation On Reading-comprehension},
author = {James Yi Tian and Alexander P. Kreuzer and Pai-Hung Chen and Hans-Martin Will},
journal= {arXiv preprint arXiv:1912.06638},
year = {2020}
}
备注
Added Figure, minor edits for clarity