中文

基于强化学习的黑箱检索文档优化

计算与语言 2026-04-08 v1 信息检索

摘要

文档扩展是一种提高检索质量的经典技术,由于将计算转移到离线进行而具有吸引力。然而,当应用于现代检索器时,它已被证明会降低性能,常常引入噪声从而掩盖判别性信号。我们将文档扩展重新表述为文档优化问题:语言模型或视觉语言模型通过GRPO进行微调,将文档转换为更好地与目标检索器下的期望查询分布对齐的表示,以检索器的排序提升作为奖励。该方法仅需对检索排序的黑箱访问,且适用于单向量、多向量和词表检索器。我们在代码检索和视觉文档检索(VDR)任务上评估了我们的方法。我们发现学习到的文档转换带来了检索增益,在许多设置中使更小、更高效的检索器超越更大的检索器。例如,将文档优化应用于OpenAI text-embedding-3-small模型,在代码检索上将nDCG5从58.7提升至66.8,在VDR上从53.3提升至57.6,甚至略微超越了6.5倍昂贵的OpenAI text-embedding-3-large模型(代码检索66.3,VDR 57.0)。当检索器权重可访问时,文档优化通常与微调具有竞争力,在大多数设置中两者结合效果最佳,在VDR上将Jina-ColBERT-V2从55.8提升至63.3,在代码检索上从48.6提升至61.8。

关键词

引用

@article{arxiv.2604.05087,
  title  = {Document Optimization for Black-Box Retrieval via Reinforcement Learning},
  author = {Omri Uzan and Ron Polonsky and Douwe Kiela and Christopher Potts},
  journal= {arXiv preprint arXiv:2604.05087},
  year   = {2026}
}