中文

基于蒸馏句子嵌入的可扩展注意力句子对建模

机器学习 2019-11-22 v3 计算与语言 机器学习

摘要

近期最先进的自然语言理解模型,如 BERT 与 XLNet,使用多重交叉注意力操作对一对句子(A 与 B)进行打分——该过程中句子 A 的每个词都注意力于句子 B 的所有词,反之亦然。因此,计算查询句与一组候选句之间的相似度,需要将全部查询-候选句对经由一层层交叉注意力栈传播。当候选句数量很大时,这一穷举过程在计算上难以承受。相比之下,句子嵌入技术学习句子到向量的映射,并通过简单基本运算计算句向量间相似度。本文中,我们引入蒸馏句子嵌入(DSE)——一种基于从交叉注意力模型进行知识蒸馏、聚焦于句子对任务的模型。DSE 的框架如下:给定交叉注意力教师模型(例如微调后的 BERT),我们训练基于句子嵌入的学生模型来重构教师模型所得的句子对分数。我们在五个 GLUE 句子对任务上实证展示了 DSE 的有效性。DSE 显著优于若干 ELMO 变体与其他句子嵌入方法,同时将查询-候选句对相似度的计算加速数个数量级,相较 BERT 平均相对退化 4.6%。此外,我们表明 DSE 产生的句子嵌入在通用句子表示基准上达到了最先进性能。我们的代码已公开于 https://github.com/microsoft/Distilled-Sentence-Embedding。

关键词

引用

@article{arxiv.1908.05161,
  title  = {Scalable Attentive Sentence-Pair Modeling via Distilled Sentence Embedding},
  author = {Oren Barkan and Noam Razin and Itzik Malkiel and Ori Katz and Avi Caciularu and Noam Koenigstein},
  journal= {arXiv preprint arXiv:1908.05161},
  year   = {2019}
}

备注

In Proceedings of AAAI 2020