利用跨架构知识蒸馏改进高效神经排序模型
信息检索
2021-01-25 v2
摘要
检索与排序模型是许多应用(如网页搜索、开放域问答或基于文本的推荐系统)的支柱。神经排序模型在查询时的延迟在很大程度上取决于其架构以及设计者有意识地权衡效果与更高效率的选择。越来越多高效排序架构对低查询延迟的关注,使它们得以在生产环境中部署。在机器学习中,缩小更高效模型效果差距的一种日益常见的方法,是将知识蒸馏从大型教师模型应用于较小的学生模型。我们发现不同的排序架构往往产生不同量级的输出分数。基于这一发现,我们提出了一种带有聚焦间隔损失(Margin-MSE)的跨架构训练流程,使知识蒸馏适应不同 BERT 与非 BERT 段落排序架构各异的分数输出分布。我们将可迁移的信息作为额外的细粒度标签,应用于 MSMARCO-Passage 集合已有的训练三元组上。我们评估了将最先进的拼接 BERT 模型的知识蒸馏到四种不同高效架构(TK、ColBERT、PreTT 以及一种 BERT CLS 点积模型)的流程。我们表明,在所评估的架构中,我们的 Margin-MSE 知识蒸馏在保持其效率的同时显著提升了重排序效果。此外,我们展示了我们通用的蒸馏方法可改进基于最近邻的索引检索(使用 BERT 点积模型),在与专用且成本高得多的训练方法相比时提供了有竞争力的结果。为使社区受益,我们以即用包的形式发布了教师分数训练文件。
引用
@article{arxiv.2010.02666,
title = {Improving Efficient Neural Ranking Models with Cross-Architecture Knowledge Distillation},
author = {Sebastian Hofstätter and Sophia Althammer and Michael Schröder and Mete Sertkan and Allan Hanbury},
journal= {arXiv preprint arXiv:2010.02666},
year = {2021}
}
备注
Updated paper with dense retrieval results and query-level analysis