面向生成式检索的学习化分词方法
信息检索
2023-04-11 v1
摘要
传统的文档检索技术主要基于索引-检索范式。基于该范式优化流水线以端到端方式进行的难度较大。作为替代,生成式检索将文档表示为标识符(docid)并通过生成 docids 来检索文档,从而实现对文档检索任务的端到端建模。然而,应如何定义文档标识符仍是一个开放问题。当前定义文档标识符的任务依赖于固定的基于规则的 docids,例如文档标题或聚类 BERT 嵌入的结果,这些方法往往无法捕获文档的完整语义信息。我们提出 GenRet,一种文档分词学习方法,以应对生成式检索中文档标识符定义的挑战。GenRet 通过离散自编码方法学习将文档分词为短离散表示(即 docids)。GenRet 包含三个组件:(i)为文档生成 docids 的分词模型;(ii)学习基于 docid 重建文档的重建模型;(iii)为指定查询直接生成相关文档标识符的序列到序列检索模型。通过使用自编码框架,GenRet 以完全端到端的方式学习语义 docids。我们还开发了一种渐进式训练方案,以捕获 docids 的自回归特性并稳定训练。我们在 NQ320K、MS MARCO 和 BEIR 数据集上进行了实验以评估 GenRet 的有效性。GenRet 在 NQ320K 数据集上确立了新的 SOTA。特别地,与生成式检索基线相比,GenRet 在未见文档上能取得显著改进。GenRet 在 MS MARCO 和 BEIR 上也优于可比基线,证明了该方法的泛化能力。
引用
@article{arxiv.2304.04171,
title = {Learning to Tokenize for Generative Retrieval},
author = {Weiwei Sun and Lingyong Yan and Zheng Chen and Shuaiqiang Wang and Haichao Zhu and Pengjie Ren and Zhumin Chen and Dawei Yin and Maarten de Rijke and Zhaochun Ren},
journal= {arXiv preprint arXiv:2304.04171},
year = {2023}
}