稠密检索的测试时计算:基于冻结嵌入模型的智能体程序生成
机器学习
2026-05-28 v4 计算与语言
信息检索
摘要
测试时计算被广泛认为仅对大型推理模型有益。我们证明它也有助于小型嵌入模型。由于现代嵌入模型是从 LLM 骨干网络中蒸馏而来,一个冻结的编码器应能从额外的推理计算中获益而无需重新训练。一个智能体程序搜索循环在冻结编码器 API 上探索了 144 个候选程序,并产生了 12 个帕累托最优程序,这些程序以额外的推理计算换取检索质量。该搜索独立地重新发现了 Rocchio 伪相关反馈、句子粒度的 ColBERT 风格 MaxSim、倒数排序融合以及 Fisher 线性判别,所有这些都不需要可训练参数或外部模型。在程序搜索期间使用的所有 14 个任务上,每个前沿程序都相对于冻结基线提高了 nDCG@10。泛化性被单独验证:一个在留出评估之前从发现前沿中选择的单一固定程序,在三个未见过的编码器家族和十九个留出检索任务上,于 61% 的模型-任务对中提高了 nDCG@10,无需任何按任务选择。
引用
@article{arxiv.2605.11374,
title = {Test-Time Compute for Dense Retrieval: Agentic Program Generation with Frozen Embedding Models},
author = {Han Xiao},
journal= {arXiv preprint arXiv:2605.11374},
year = {2026}
}
备注
17 pages, 4 figures, 5 tables