蒸馏 versus 对比学习:如何训练您的重排器
计算与语言
2025-11-07 v3 信息检索
摘要
训练有效的文本重排器对信息检索至关重要。两种策略广泛用于:对比学习(直接优化以真实标签)和知识蒸馏(从更大模型传递知识)。虽然两者都有大量研究,但在实际条件下,对跨编码器重排器的有效性进行清晰比较仍有必要。本文通过在相同数据上训练不同规模(0.5B、1.5B、3B、7B)和体系结构(Transformer、循环)的重排器,分别使用这两种方法,同时以强大的对比学习模型作为蒸馏教师, empirically 比较了这些策略的效果。我们的结果表明,知识蒸馏通常在同一领域和跨领域的排序性能上优于对比学习,当从更具性能的教师模型进行蒸馏时,这一发现在学生模型规模和体系结构上均得到验证。然而,从容量相同的教师进行蒸馏并不提供相同的优势,特别是针对跨领域任务。这些发现为基于可用教师模型选择训练策略提供了实用指导。我们建议如果可获取更大更具性能的教师模型,请使用知识蒸馏训练较小的重排器;在教师不可用的情况下,对比学习仍是稳健的基线。我们的代码实现已公开,以促进可重复性。
引用
@article{arxiv.2507.08336,
title = {Distillation versus Contrastive Learning: How to Train Your Rerankers},
author = {Zhichao Xu and Zhiqi Huang and Shengyao Zhuang and Vivek Srikumar},
journal= {arXiv preprint arXiv:2507.08336},
year = {2025}
}
备注
IJCNLP-AACL 2025 Findings