反事实学习排序中的鲁棒泛化与安全查询特化
机器学习
2021-02-23 v2 信息检索
摘要
现有的反事实学习排序(LTR)工作集中于优化基于特征的模型,这些模型根据文档特征预测最优排序。基于bandit算法的LTR方法通常优化表格模型,记忆每个查询的最优排序。这两类模型各有优缺点。基于特征的模型在许多查询(包括先前未见的查询)上提供非常鲁棒的性能,然而,可用特征常常限制了模型可预测的排序。相反,表格模型可通过记忆收敛到任意可能的排序。但是,记忆极易受噪声影响,这使得表格模型仅在有大量用户交互可用时才可靠。我们能否开发一种鲁棒的反事实LTR方法,在安全的情形下追求基于记忆的优化?我们提出泛化与特化(GENSPEC)算法,一种鲁棒基于特征的反事实LTR方法,在安全的情形下追求逐查询记忆。GENSPEC优化单一基于特征的模型以泛化:在所有查询上的鲁棒性能,以及许多表格模型以特化:每个针对单一查询上的高性能优化。GENSPEC使用新颖的相对高置信界来选择每个查询部署哪个模型。由此,GENSPEC兼具成功特化表格模型的高性能与泛化基于特征模型的鲁棒性。我们的结果表明,GENSPEC在具有充足点击数据的查询上达到最优性能,同时在具有少量或噪声数据的查询上表现出鲁棒行为。
引用
@article{arxiv.2102.05990,
title = {Robust Generalization and Safe Query-Specialization in Counterfactual Learning to Rank},
author = {Harrie Oosterhuis and Maarten de Rijke},
journal= {arXiv preprint arXiv:2102.05990},
year = {2021}
}
备注
In Proceedings of the Web Conference 2021 (WWW '21), April 19-23, 2021, Ljubljana, Slovenia. ACM, New York, NY, USA, 12 pages