中文

小型语言模型文档重排序推理的蒸馏与精炼

信息检索 2025-07-01 v3 计算与语言

摘要

我们提出了一种新方法,用于训练用于推理密集型文档排序的小型语言模型,结合了知识蒸馏与强化学习优化。虽然现有方法常依赖昂贵的人类标注或大型黑箱语言模型,但我们的 методology 利用网络数据和教师 LLM 自动生成高质量的训练示例并附带相关性解释。通过将文档排序问题表述为强化学习问题并激励显式推理能力,我们训练了一个参数量为 3B 的紧凑语言模型,在 BRIGHT 数据集上实现了最新的性能。该模型在排名榜上位列第三,却使用了比其他方法少得多的参数,甚至超过了 20 倍大小的模型。通过大量实验,我们展示了在推理过程中生成解释而非直接预测相关性得分,能够更有效地为小型语言模型提供推理。该方法的自监督特性为现代信息检索系统提供了可扩展且可解释的解决方案。

关键词

引用

@article{arxiv.2504.03947,
  title  = {Distillation and Refinement of Reasoning in Small Language Models for Document Re-ranking},
  author = {Chris Samarinas and Hamed Zamani},
  journal= {arXiv preprint arXiv:2504.03947},
  year   = {2025}
}