中文

Syntriever:如何利用LLM生成的合成数据训练检索器

计算与语言 2025-02-17 v3 人工智能

摘要

大语言模型(LLM)推动了许多AI应用的进步。最近,有尝试将LLM的广博知识蒸馏到信息检索系统中。这些蒸馏方法大多使用LLM的输出概率,而这些概率在最新的黑盒LLM中是无法获取的。我们提出了Syntriever,一个利用黑盒LLM生成的合成数据训练检索器的框架。Syntriever包含两个阶段。首先,在蒸馏阶段,我们利用思维链为给定查询合成相关段落和看似不相关的段落以及增强查询。要求LLM自我验证合成数据中可能存在的幻觉,之后使用一种旨在将相关段落的嵌入进行聚类的损失函数来训练检索器。其次,在对齐阶段,我们将检索器与LLM的偏好对齐。我们提出了一种称为部分Plackett-Luce排序的偏好建模方法,以学习带有正则化的LLM偏好,该正则化可防止模型过度偏离在蒸馏阶段训练得到的模型。实验表明,Syntriever在来自不同领域的基准数据集上,在nDCG@KK指标上取得了最先进的性能。代码可在\href{https://github.com/kmswin1/Syntriever}{https://github.com/kmswin1/Syntriever}获取。

关键词

引用

@article{arxiv.2502.03824,
  title  = {Syntriever: How to Train Your Retriever with Synthetic Data from LLMs},
  author = {Minsang Kim and Seungjun Baek},
  journal= {arXiv preprint arXiv:2502.03824},
  year   = {2025}
}

备注

the Nations of the Americas Chapter of the Association for Computational Linguistics (NAACL), Findings, Accepted