一种模型就够了:来自 LLM 代理隐藏状态的原生检索嵌入
计算与语言
2026-03-10 v1 人工智能
信息检索
摘要
执行外部知识检索的 LLM 代理通常生成文本搜索查询,然后运行单独的嵌入模型将其编码为向量。这一两个模型管道增加了基础设施复杂度和延迟,却是多余的:LLM 已经在其隐藏状态中编码了完整的对话上下文。我们提出为 LLM 代理添加原生检索功能,通过添加轻量级投影头将隐藏状态直接映射到嵌入空间,从而消除对单独嵌入模型的需求。该方法结合对齐、对比和排名蒸馏损失进行训练,保持 97% 的基线检索质量,使 LLM 代理能够使用自身表示进行搜索。在 QReCC 对话搜索基准测试中,我们的实验显示其 Recall@10 和 MRR@10 表现与标准的生成-编码管道相当,并通过系统性消融实验确认每个损失组件的贡献。
引用
@article{arxiv.2603.08429,
title = {One Model Is Enough: Native Retrieval Embeddings from LLM Agent Hidden States},
author = {Bo Jiang},
journal= {arXiv preprint arXiv:2603.08429},
year = {2026}
}