中文

分层检索:几何性质与预训练-微调方案

信息检索 2025-09-23 v1 计算与语言 机器学习 机器学习

摘要

双编码器 (DE) 模型将一对匹配的查询和文档嵌入到相似的向量表示中,因其简单性和可扩展性而在信息检索中被广泛使用。然而,嵌入空间的欧几里得几何性质限制了 DE 的表达能力,这可能损害其质量。本文在分层检索 (HR) 的背景下研究了此类局限性,其中文档集具有分层结构,且查询的匹配文档为其所有祖先节点。我们首先证明,只要嵌入维度与分层深度的关系是线性的,且与文档数量的关系是对数级的,DE 即可用于 HR。然后,我们在标准检索设置中研究了学习此类嵌入的问题,其中 DE 在匹配的查询-文档对样本上进行训练。我们的实验揭示了一种“长距离迷失”现象,即检索准确率在分层中距离较远的文档上会下降。为了解决这个问题,我们引入了一种预训练-微调方案,该方案在不牺牲较近文档性能的情况下,显著提高了长距离检索的效果。我们在 WordNet 的现实分层结构上进行了实验,以检索不同抽象级别的文档,并表明预训练-微调将长距离对的召回率从 19% 提高到了 76%。最后,我们证明了我们的方法在购物查询数据集上能改进相关产品的检索。

关键词

引用

@article{arxiv.2509.16411,
  title  = {Hierarchical Retrieval: The Geometry and a Pretrain-Finetune Recipe},
  author = {Chong You and Rajesh Jayaram and Ananda Theertha Suresh and Robin Nittka and Felix Yu and Sanjiv Kumar},
  journal= {arXiv preprint arXiv:2509.16411},
  year   = {2025}
}

备注

NeurIPS 2025