从相关性判断分布中学习排序
信息检索
2022-02-15 v1
摘要
学习排序(LETOR)算法通常在标注语料上训练,其中为每个可用的文档-主题对分配单一相关性标签。在Cranfield框架下,相关性标签由多个专家策展或众包人工评估合并而得。本文中,我们探索如何使用分配给文档-主题对的相关性判断分布(真实或合成生成)而非单值相关性标签来训练LETOR模型。我们提出五种新的概率损失函数以处理相关性判断分布所提供的更高表达能力,并展示其如何应用于神经与GBM架构。此外,我们表明在某些概率分布的相关性判断的采样版本上训练LETOR模型可提升其性能,无论依赖传统还是概率损失函数。最后,我们在真实世界众包相关性判断分布上验证我们的假设。总体而言,我们观察到依赖相关性判断分布训练不同LETOR模型可提升其性能,并在多个测试集上甚至优于如LambdaMART等强基线。
引用
@article{arxiv.2202.06337,
title = {Learning to Rank from Relevance Judgments Distributions},
author = {Alberto Purpura and Gianmaria Silvello and Gian Antonio Susto},
journal= {arXiv preprint arXiv:2202.06337},
year = {2022}
}