中文

O1 Embedder:让检索模型在行动前思考

计算与语言 2025-02-13 v2

摘要

大型语言模型(LLM)的不断提升彻底改变了人们获取和利用信息的方式。值得注意的是,LLM 在进行细粒度数据表示方面表现卓越,这促进了对信息的精准检索。它们还能基于外部参考生成高质量答案,促进了有用知识的生产。近期引入的推理模型,如 OpenAI O1 和 DeepSeek R1,标志着又一个飞跃,凸显了 LLM 在交付最终答案前进行 progressive 思考的能力。这一突破显著提升了解决复杂任务(如编码和数学证明)的能力。着于此进展,我们致力于开发类似的能力用于检索模型,这些模型在解决包括多任务检索、零样本检索以及需要对复杂关系进行密集推理的任务方面具有巨大的潜力。为此,我们提出了一种新方法,称为 O1 Embedder,通过在为输入查询生成有用思想后,再进行目标文档检索来实现目标。为实现这一目标,我们克服了两个技术难题。首先,我们设计了数据合成工作流程,通过生成来自 LLM 专家的初始思想并随后由检索委员会进行细化来为 O1 Embedder 创建训练信号。其次,我们优化了训练过程,使预训练模型能够通过行为克隆生成检索思想,同时通过对比学习执行密集检索。我们通过全面实验评估了该方法,在 12 个流行数据集上实现了显著提升,涵盖内域和外域场景。这些结果突显了 O1 Embedder 卓越的准确性和通用性,为开发下一代检索基础模型指明了方向。

关键词

引用

@article{arxiv.2502.07555,
  title  = {O1 Embedder: Let Retrievers Think Before Action},
  author = {Ruiran Yan and Zheng Liu and Defu Lian},
  journal= {arXiv preprint arXiv:2502.07555},
  year   = {2025}
}