中文

统一离策略学习排序:一种强化学习视角

机器学习 2023-10-31 v3 信息检索

摘要

离策略学习排序(LTR)旨在利用已部署日志策略收集的数据优化排序器。然而,现有离策略学习排序方法常对用户生成点击数据的方式(即点击模型)做强假设,因而需在不同点击模型下专门定制方法。本文将一般随机点击模型下的排序过程统一为马尔可夫决策过程(MDP),并可借助离线强化学习(RL)直接学习最优排序。在此基础上,我们利用离线 RL 技术研发了离策略 LTR 方法——与点击模型无关的统一离策略学习排序(CUOLR)方法,其可轻松应用于广泛范围的点击模型。通过对 MDP 的专门建模,我们表明离线 RL 算法可适配各类点击模型,而无需复杂的去偏技术与该模型先验知识。在多个大规模数据集上的结果表明,CUOLR 在不同点击模型下保持一致性与鲁棒性的同时,持续优于最先进的离策略学习排序算法。

关键词

引用

@article{arxiv.2306.07528,
  title  = {Unified Off-Policy Learning to Rank: a Reinforcement Learning Perspective},
  author = {Zeyu Zhang and Yi Su and Hui Yuan and Yiran Wu and Rishab Balasubramanian and Qingyun Wu and Huazheng Wang and Mengdi Wang},
  journal= {arXiv preprint arXiv:2306.07528},
  year   = {2023}
}

备注

accepted by Neruips 2023