翻转知识蒸馏:利用小模型专长增强大语言模型在文本匹配中的表现
计算与语言
2025-07-09 v1
摘要
知识蒸馏通常涉及将知识从大语言模型 (LLM) 迁移到小语言模型 (SLM)。然而,在文本匹配等任务中,微调后的小模型往往能产生更有效的领域特定表示,因为它们专注于优化输入对的相似度。为了同时利用小模型的专门优势和 LLM 丰富的语义理解,我们引入了一种翻转的知识蒸馏范式,其中 LLM 向 SLM 学习。具体来说,我们通过使用 LoRA 以编码器-解码器的方式重新解释 LLM,来解决仅解码器 LLM 与基于编码器的小模型之间的架构差距。编码器生成压缩表示,而解码器将其映射到输出空间。在训练期间,编码器产生表示及其相似度,然后使用我们提出的边界感知对比学习 (MCL) 方法,将这些表示与教师产生的相似度分数对齐。MCL 确保正负对的相似度准确,并自适应地处理正负样本内部的差异。我们的范式只需要一个性能尚可的 SLM,就能让 LLM 实现性能提升。在金融和医疗基准测试以及实际应用中的实验证实了其有效性,并且该模型已完全部署在在线环境中。
引用
@article{arxiv.2507.05617,
title = {Flipping Knowledge Distillation: Leveraging Small Models' Expertise to Enhance LLMs in Text Matching},
author = {Mingzhe Li and Jing Xiang and Qishen Zhang and Kaiyang Wan and Xiuying Chen},
journal= {arXiv preprint arXiv:2507.05617},
year = {2025}
}
备注
Accepted by ACL 2025 main