中文

RankT5:使用排序损失微调 T5 进行文本排序

信息检索 2022-10-20 v1 计算与语言

摘要

近来,基于 BERT 等预训练语言模型的文本排序取得了实质性进展。然而,关于如何利用更强大的序列到序列模型(如 T5)的研究有限。现有尝试通常将文本排序表述为分类问题,并依赖后处理来获得排序列表。本文中,我们提出 RankT5 并研究两种基于 T5 的排序模型结构,一种编码器-解码器结构和一种仅编码器结构,使它们不仅可以直接输出每个查询-文档对的相关性得分,还能通过“成对”或“列表式”排序损失进行微调以优化排序性能。我们的实验表明,所提出的带排序损失的模型在不同公开文本排序数据集上能取得实质性的排序性能提升。此外,当使用列表式排序损失微调时,相较于使用分类损失微调的模型,该排序模型在域外数据集上展现出更好的零样本排序性能。

关键词

引用

@article{arxiv.2210.10634,
  title  = {RankT5: Fine-Tuning T5 for Text Ranking with Ranking Losses},
  author = {Honglei Zhuang and Zhen Qin and Rolf Jagerman and Kai Hui and Ji Ma and Jing Lu and Jianmo Ni and Xuanhui Wang and Michael Bendersky},
  journal= {arXiv preprint arXiv:2210.10634},
  year   = {2022}
}

备注

13 pages