中文

WaLDORf:面向阅读理解的无浪费语言模型蒸馏

机器学习 2020-02-20 v2 计算与语言

摘要

基于 Transformer 的超大型语言模型(VLLM),如 BERT、XLNet 和 RoBERTa,近来在大量自然语言理解(NLU)任务上展现出卓越性能。然而,由于其规模,这些 VLLM 极其消耗资源,且在生产环境部署时十分笨重。近期的若干文献探讨了将基于 transformer 的 VLLM(最常见为 BERT-Base)中的知识以多种方式蒸馏到更小的模型,从而在推理时大幅加速。在此,我们提出一组新技术,共同产生一个任务特定的卷积与 transformer 混合模型 WaLDORf,其在实现 SOTA 推理速度的同时,仍比此前的蒸馏模型更准确。

关键词

引用

@article{arxiv.1912.06638,
  title  = {WaLDORf: Wasteless Language-model Distillation On Reading-comprehension},
  author = {James Yi Tian and Alexander P. Kreuzer and Pai-Hung Chen and Hans-Martin Will},
  journal= {arXiv preprint arXiv:1912.06638},
  year   = {2020}
}

备注

Added Figure, minor edits for clarity