文档排序中同构架构知识蒸馏的实证研究
信息检索
2023-02-09 v1
摘要
尽管基于 BERT 的排序模型已常用于商业搜索引擎,但它们对在线排序任务通常耗时较多。知识蒸馏旨在学习一个性能可与更大模型媲美的小模型,是降低在线推理延迟的常用策略。本文中,我们研究不同损失函数对基于 BERT 的排序模型同构架构蒸馏的影响。此处“同构架构”指教师与学生模型均为交叉编码器(cross-encoder)架构,而学生模型包含小规模的预训练语言模型。实验结果表明,排序任务的最优蒸馏配置与一般自然语言处理任务大不相同。具体而言,当学生模型为交叉编码器架构时,硬标签的成对损失对训练学生模型至关重要,而中间 Transformer 层的蒸馏目标可能损害性能。这些发现强调了精心设计并针对带成对训练样本的文档排序定制的蒸馏策略(针对交叉编码器学生模型)的必要性。
引用
@article{arxiv.2302.04112,
title = {An Empirical Study of Uniform-Architecture Knowledge Distillation in Document Ranking},
author = {Xubo Qin and Xiyuan Liu and Xiongfeng Zheng and Jie Liu and Yutao Zhu},
journal= {arXiv preprint arXiv:2302.04112},
year = {2023}
}