从 Transformer 到 CNN:面向标签稀缺文本分类的蒸馏方法
机器学习
2019-09-10 v1 计算与语言
信息检索
机器学习
摘要
自 2018 年初以来,自然语言处理(NLP)建模取得了显著进展。这些新方法即使在标注数据很少时也能给出准确结果,因为这些 NLP 模型可从与任务无关及任务特定的无标注数据中获益。然而,这些优势伴随着巨大的模型规模与计算代价。本 workshop 论文概述了我们提出的卷积学生架构如何通过从大规模模型的蒸馏过程进行训练,从而实现 300 倍的推理加速与 39 倍的参数量缩减。在某些情况下,学生模型在所研究任务上的表现超越了其教师模型。
引用
@article{arxiv.1909.03508,
title = {Transformer to CNN: Label-scarce distillation for efficient text classification},
author = {Yew Ken Chia and Sam Witteveen and Martin Andrews},
journal= {arXiv preprint arXiv:1909.03508},
year = {2019}
}
备注
Accepted paper for CDNNRIA workshop at NeurIPS 2018. (3 pages + references)