PARADE:用于文档重排序的段落表示聚合
信息检索
2021-06-11 v2
摘要
预训练 transformer 模型,如 BERT 和 T5,已被证明在临时段落与文档排序上极为有效。由于这些模型固有的序列长度限制,它们需要在文档的各段落上运行,而非一次性处理整个文档序列。尽管已提出若干聚合段落级信号的方法,但这些技术尚缺乏广泛比较。本工作中,我们探索将文档各段落的相关性信号聚合为最终排序分数的策略。我们发现,段落表示聚合技术可显著优于先前工作中提出的技术,如取段落最高分。我们将这一新方法称为 PARADE。具体而言,PARADE 在具有宽泛信息需求、相关性信号可能散布于文档各处的集合(如 TREC Robust04 和 GOV2)上可显著改善结果。同时,在信息需求常可定位至单一段落的集合(如 TREC DL 和 TREC Genomics)上,较不复杂的聚合技术可能表现更好。我们还进行了效率分析,并强调了若干改进基于 transformer 的聚合的策略。
引用
@article{arxiv.2008.09093,
title = {PARADE: Passage Representation Aggregation for Document Reranking},
author = {Canjia Li and Andrew Yates and Sean MacAvaney and Ben He and Yingfei Sun},
journal= {arXiv preprint arXiv:2008.09093},
year = {2021}
}