中文

TwinBERT:将知识蒸馏至双结构 BERT 模型以实现高效检索

信息检索 2020-02-18 v1 机器学习

摘要

诸如 BERT 的预训练语言模型已在各类 NLP 任务中取得巨大成功,但其优越性能伴随高昂的计算资源需求,阻碍了在低延迟 IR 系统中的应用。我们提出用于高效且有效检索的 TwinBERT 模型,其具有类 BERT 的双结构编码器分别表征查询与文档,以及一层交叉层结合嵌入并生成相似度分数。不同于将两句输入拼接并共同编码的 BERT,TwinBERT 在编码时解耦二者,独立生成查询与文档的嵌入,从而允许文档嵌入离线预计算并缓存于内存中。如此,运行时仅余查询编码与查询-文档交叉的计算。这一改动可节省大量计算时间与资源,从而显著提升服务效率。此外,提出若干精心设计的网络层与训练策略,以进一步降低计算成本,同时保持与 BERT 模型相当的性能。最后,我们对应检索与相关性任务开发了 TwinBERT 的两个版本,二者均取得接近或匹敌 BERT-Base 模型的性能。该模型遵循教师-学生框架训练,并使用某主要搜索引擎的数据评估。实验结果表明推理时间显著缩短,并首次在 CPU 上控制在约 20ms,同时基本保留了微调 BERT-Base 模型带来的性能提升。将模型集成至生产系统亦显示出相关性指标的显著提升,且对延迟影响可忽略。

关键词

引用

@article{arxiv.2002.06275,
  title  = {TwinBERT: Distilling Knowledge to Twin-Structured BERT Models for Efficient Retrieval},
  author = {Wenhao Lu and Jian Jiao and Ruofei Zhang},
  journal= {arXiv preprint arXiv:2002.06275},
  year   = {2020}
}