中文

上下文文档排序中段落级标签迁移的深入分析

信息检索 2023-12-07 v3

摘要

BERT、GPT 和 XLnet 等预训练上下文语言模型在文档检索任务上表现良好。此类模型基于查询-文档/查询-段落级相关性标签进行微调以捕捉排序信号。然而,文档长于段落,此类文档排序模型受限于 BERT 的 token 上限(512)。研究者提出了截断超出 token 限制的文档或将文档切分为可放入 BERT 的单元的排序策略。在后一种情况下,相关性标签要么直接从原始查询-文档对迁移,要么通过某些外部模型学习。本文中,我们针对切分与标签迁移的设计决策对检索效果与效率的影响进行了详细研究。我们发现,将相关性标签从文档直接迁移至段落会引入标签噪声,对大型训练数据集的检索效果产生强烈影响。我们还发现,细粒度切分方案会对查询处理时间产生不利影响。作为补救,我们提出一种利用弱监督的精细段落级标注方案,在四个不同的文档检索数据集上,相较于近期提出的大多数 ad-hoc 检索模型,在保持可控计算复杂度的同时取得了更优性能(以 nDCG 分数计提升 3–14%)。

关键词

引用

@article{arxiv.2103.16669,
  title  = {An In-depth Analysis of Passage-Level Label Transfer for Contextual Document Ranking},
  author = {Koustav Rudra and Zeon Trevor Fernando and Avishek Anand},
  journal= {arXiv preprint arXiv:2103.16669},
  year   = {2023}
}

备注

Paper is about the performance analysis of contextual ranking strategies in an ad-hoc document retrieval