统一离策略学习排序:一种强化学习视角
机器学习
2023-10-31 v3 信息检索
摘要
离策略学习排序(LTR)旨在利用已部署日志策略收集的数据优化排序器。然而,现有离策略学习排序方法常对用户生成点击数据的方式(即点击模型)做强假设,因而需在不同点击模型下专门定制方法。本文将一般随机点击模型下的排序过程统一为马尔可夫决策过程(MDP),并可借助离线强化学习(RL)直接学习最优排序。在此基础上,我们利用离线 RL 技术研发了离策略 LTR 方法——与点击模型无关的统一离策略学习排序(CUOLR)方法,其可轻松应用于广泛范围的点击模型。通过对 MDP 的专门建模,我们表明离线 RL 算法可适配各类点击模型,而无需复杂的去偏技术与该模型先验知识。在多个大规模数据集上的结果表明,CUOLR 在不同点击模型下保持一致性与鲁棒性的同时,持续优于最先进的离策略学习排序算法。
引用
@article{arxiv.2306.07528,
title = {Unified Off-Policy Learning to Rank: a Reinforcement Learning Perspective},
author = {Zeyu Zhang and Yi Su and Hui Yuan and Yiran Wu and Rishab Balasubramanian and Qingyun Wu and Huazheng Wang and Mengdi Wang},
journal= {arXiv preprint arXiv:2306.07528},
year = {2023}
}
备注
accepted by Neruips 2023