PoolRank:基于最大/最小池化的列表式学习排序损失与排序平衡方法
信息检索
2021-08-10 v1
摘要
近年来提出了众多神经检索模型。这些模型学习计算给定查询与文档之间的排序得分。现有多数模型以成对方式直接利用人工标注标签进行训练而未加进一步校准。传统成对方案可能耗时,且需要预定义的正负文档对用于训练,可能因训练与测试条件下文档分布不匹配而导致学习偏差。一些流行的现有列表式方案依赖于强预定义概率假设以及给定查询下相关与非相关文档间的显著差异,由于相关性标签质量低或模糊,这可能限制模型潜力。为解决这些问题,我们转向受物理学启发的排序平衡方案,并提出 PoolRank,一种基于池化的列表式学习框架。所提方案具有四大优势:(1) PoolRank 基于模型性能及丰富文档候选间的相对排序,在局部层面从最优候选中提取训练信息。(2) 通过以多任务学习方式组合四个基于池化的损失分量,PoolRank 自动校准部分相关与高度不相关文档的排序平衡,无需昂贵的人工检查。(3) PoolRank 可轻松推广至任意神经检索模型,无需额外可学习参数或模型结构修改。(4) 与成对学习及现有列表式学习方案相比,PoolRank 在所有研究的检索模型中均取得更优排序性能,同时保持高效收敛速率。
引用
@article{arxiv.2108.03586,
title = {PoolRank: Max/Min Pooling-based Ranking Loss for Listwise Learning & Ranking Balance},
author = {Zhizhong Chen and Carsten Eickhoff},
journal= {arXiv preprint arXiv:2108.03586},
year = {2021}
}