生成式检索如何扩展到数百万文档段?
信息检索
2023-05-22 v1 计算与语言
摘要
由可微搜索索引(Differentiable Search Index)推广而来的生成式检索新范式,将经典的信息检索问题重构为序列到序列建模任务,摒弃外部索引并在单一 Transformer 中编码整个文档语料库。尽管已提出许多不同方法来提升生成式检索的效果,但它们仅在规模约为 10 万量级的文档语料上进行了评估。我们开展了首项跨不同语料规模的生成式检索技术实证研究,最终扩展到整个 MS MARCO 文档段排序任务(含 8.8M 文档段语料)并评估了参数规模达 11B 的模型。我们揭示了关于将生成式检索扩展到数百万文档段的若干发现;值得注意的是:在索引期间使用合成查询作为文档表示具有核心重要性,现有提出的架构修改在计入计算成本时无效,以及单纯扩展模型参数在检索性能上的局限。虽然我们发现生成式检索在小语料上与最先进的双编码器具有竞争力,但扩展到数百万文档段仍是一项重要且未解决的挑战。我们相信这些发现对社区厘清生成式检索现状、凸显独特挑战并启发新研究方向具有价值。
引用
@article{arxiv.2305.11841,
title = {How Does Generative Retrieval Scale to Millions of Passages?},
author = {Ronak Pradeep and Kai Hui and Jai Gupta and Adam D. Lelkes and Honglei Zhuang and Jimmy Lin and Donald Metzler and Vinh Q. Tran},
journal= {arXiv preprint arXiv:2305.11841},
year = {2023}
}