中文

BERT2DNN:利用海量无标签数据的 BERT 蒸馏用于在线电商搜索

机器学习 2020-10-21 v1 人工智能 信息检索

摘要

相关性对电商搜索平台的用户体验与商业利润有显著影响。本工作中,我们提出一个数据驱动的搜索相关性预测框架,通过将 BERT 及相关的多层 Transformer 教师模型的知识蒸馏到带有大量无标签数据的简单前馈网络中。该蒸馏过程产生的学生模型在新查询上恢复了教师模型超过 97% 的测试精度,而服务成本降低数个数量级(延迟比 BERT-Base 低 150 倍,比最高效的 BERT 变体 TinyBERT 低 15 倍)。温度重缩放与教师模型堆叠的应用进一步提升了模型精度,且不增加学生模型复杂度。我们给出了基于内部电商搜索相关性数据以及 GLUE 基准中公开情感分析数据集的实验结果。后者利用了另一个规模大得多的相关公开数据集,同时忽略其潜在噪声标签。对内部数据的嵌入分析与案例研究进一步凸显了所得模型的优势。通过公开数据处理与模型训练源代码,我们希望本文技术有助于降低最先进 Transformer 模型的能耗,并为缺乏尖端机器学习硬件的小组织缩小竞争差距。

关键词

引用

@article{arxiv.2010.10442,
  title  = {BERT2DNN: BERT Distillation with Massive Unlabeled Data for Online E-Commerce Search},
  author = {Yunjiang Jiang and Yue Shang and Ziyang Liu and Hongwei Shen and Yun Xiao and Wei Xiong and Sulong Xu and Weipeng Yan and Di Jin},
  journal= {arXiv preprint arXiv:2010.10442},
  year   = {2020}
}

备注

10 pages, 7 figures, to appear in ICDM 2020