中文

排序中文档组的查询暴露预测

信息检索 2024-01-25 v1

摘要

信息检索系统的主要目标是为用户提供与查询最相关的文档。为此,现代 IR 系统通常部署重排序流程:由轻量级第一阶段检索过程检索一组文档,随后由更有效但成本更高的模型进行重排序。然而,重排序流程的成功严重依赖于第一阶段检索的性能,因为在重排序阶段通常不会识别新文档。此外,这会影响特定文档组(如来自特定人口群体的文档)在最终排序中获得的暴露量。例如,若第一阶段检索返回的某些群体文档过少,则暴露的公平分配将更具挑战性或无法实现,因为排序中组文档的数量比文档位置对暴露的影响更大。有鉴于此,预测一组文档在第一阶段检索结果中可能获得的暴露量是有益的,以确保每组都包含足够数量的文档。本文引入查询暴露预测(QEP)这一新任务。具体而言,我们提出首个预测文档组在给定查询下将获得的暴露分布的方法。我们称为 GEP 的新方法利用来自各个文档组的词法信息,估计这些组在排序中将获得的暴露。我们在 TREC 2021 与 2022 公平排序测试集上的实验表明,我们提出的 GEP 方法产生的暴露预测,比经适配的现有查询性能预测与资源分配方法的预测准确率高出 40%。

关键词

引用

@article{arxiv.2401.13434,
  title  = {Query Exposure Prediction for Groups of Documents in Rankings},
  author = {Thomas Jaenich and Graham McDonald and Iadh Ounis},
  journal= {arXiv preprint arXiv:2401.13434},
  year   = {2024}
}