路过再检索:激活大语言模型中隐式路由能力以应对长文本检索与选择
计算与语言
2026-05-13 v2
摘要
近期大型语言模型(LLM)的进展已将上下文窗口扩展至128K以上,使其能够理解长文档并进行多源推理。然而,一个关键挑战在于,在检索增强生成(RAG)与长上下文(LC)策略之间做出选择:RAG高效但受检索质量制约,而LC支持全局推理,但成本更高且存在位置敏感性。现有方法如Self-Route采用从RAG到LC的失败驱动回退策略,但仍被动、低效且难以解释。我们提出Pre-Route,一种在作答前进行结构化推理的主动路由框架。通过轻量级元数据(如文档类型、长度、初始片段),Pre-Route实现任务分析、覆盖估计和信息需求预测,生成可解释且高效的路由决策。我们的研究发现三个关键发现:(i)LLM具有可被指南激发的隐式路由能力,使单样本性能可接近多样本(Best-of-N)结果;(ii)线性探针表明,结构化提示在表示空间中锻炼了“最优路由维度”的可分离性;(iii)蒸馏将这种推理结构迁移到更小的模型上,以实现轻量级部署。在LaRA(域内)和LongBench-v2(域外)上的实验表明,Pre-Route超越了Always-RAG、Always-LC和Self-Route等基线,实现了卓越的整体成本效益。
引用
@article{arxiv.2605.10235,
title = {Route Before Retrieve: Activating Latent Routing Abilities of LLMs for RAG vs. Long-Context Selection},
author = {Yiwen Chen and Kuan Li and Fuzhen Zhuang and Deqing Wang and Zhao Zhang and Liwen Zhang and Yong Jiang and Shuai Wang and Minhao Cheng},
journal= {arXiv preprint arXiv:2605.10235},
year = {2026}
}