中文

DiPair:面向万亿规模文本匹配与对建模的快速精准蒸馏框架

计算与语言 2021-05-06 v1

摘要

诸如 BERT(Devlin et al., 2018)之类的预训练模型已主导了 NLP / IR 应用,如单句分类、文本对分类与问答。然而,由于其高昂的计算成本,在真实系统中部署这些模型极为困难。常见的补救方法是知识蒸馏(Hinton et al., 2015),从而加速推理。但是——正如本文所示——现有工作并未针对处理文本对(或元组)进行优化。因此,它们要么不可扩展,要么表现出次优性能。本工作中,我们提出 DiPair——一种用于文本对任务上蒸馏快速且精准模型的新型框架。结合端到端训练策略,DiPair 兼具高度可扩展性与更优的质量-速度权衡。在学术与真实世界电商基准上进行的实证研究表明,相较交叉注意力教师 BERT 模型,所提方法具有超过 350 倍的加速且质量下降极小。

关键词

引用

@article{arxiv.2010.03099,
  title  = {DiPair: Fast and Accurate Distillation for Trillion-Scale Text Matching and Pair Modeling},
  author = {Jiecao Chen and Liu Yang and Karthik Raman and Michael Bendersky and Jung-Jung Yeh and Yun Zhou and Marc Najork and Danyang Cai and Ehsan Emadzadeh},
  journal= {arXiv preprint arXiv:2010.03099},
  year   = {2021}
}

备注

13 pages. Accepted to Findings of EMNLP 2020