中文

基于序列学习过程的列表式生成检索模型

信息检索 2024-03-20 v1

摘要

近期,一种新颖的生成式检索(GR)范式被提出,其中学习一个单一的序列到序列模型,以根据查询直接生成相关文档标识符(docids)列表。现有的GR模型通常采用最大似然估计(MLE)进行优化:这涉及在给定输入查询的情况下最大化单个相关docid的似然,并假设每个docid的似然独立于列表中的其他docid。本文中我们将这些模型称为逐点式方法。虽然逐点式方法在GR背景下已被证明有效,但由于其忽视了排序涉及对列表进行预测这一基本原则,因此被认为是次优的。本文中,我们通过引入一种替代的列表式方法来解决这一局限,该方法使GR模型能够在docid列表级别优化相关性。具体而言,我们将排序docid列表的生成视为一个序列学习过程:在每一步,我们学习一个参数子集,该子集在给定(前)i-1个docid的条件下最大化第i个docid的相应生成似然。为了形式化该序列学习过程,我们为GR设计了一种位置条件概率。为了减轻推理过程中束搜索对生成质量的潜在影响,我们根据相关性等级对模型生成的docid的生成似然进行相关性校准。我们在具有代表性的二值和多等级相关性数据集上进行了广泛实验。实证结果表明,我们的方法在检索性能方面优于最先进的GR基线模型。

关键词

引用

@article{arxiv.2403.12499,
  title  = {Listwise Generative Retrieval Models via a Sequential Learning Process},
  author = {Yubao Tang and Ruqing Zhang and Jiafeng Guo and Maarten de Rijke and Wei Chen and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2403.12499},
  year   = {2024}
}

备注

Accepted by ACM Transactions on Information Systems