中文

面向BERT无监督领域自适应的知识蒸馏

计算与语言 2020-10-26 v2

摘要

预训练语言模型BERT为一系列自然语言处理任务带来了显著的性能提升。由于该模型在涵盖多样主题的大规模语料上训练,对于训练(源数据)与测试(目标数据)数据分布不同但具相似性的领域偏移问题,表现出鲁棒性能。尽管相较先前模型有巨大改进,它仍受限于领域偏移导致的性能下降。为缓解此类问题,我们提出了一种简单而有效的无监督领域自适应方法——带蒸馏的对抗自适应(AAD),将对抗判别领域自适应(ADDA)框架与知识蒸馏相结合。我们在30个领域对的跨领域情感分类任务上评估了该方法,推进了文本情感分类无监督领域自适应的当前最优性能。

关键词

引用

@article{arxiv.2010.11478,
  title  = {Knowledge Distillation for BERT Unsupervised Domain Adaptation},
  author = {Minho Ryu and Kichun Lee},
  journal= {arXiv preprint arXiv:2010.11478},
  year   = {2020}
}