电子商务搜索引擎中的强化学习排序:形式化、分析与与应用
机器学习
2018-05-24 v3
摘要
在 Amazon 与淘宝等电子商务平台中,搜索会话中的商品排序是一个典型的多次决策问题。排序学习(LTR)方法已被广泛应用于排序问题。然而,此类方法常将会话中不同的排序步骤视为相互独立的,而这些步骤实际上可能高度相关。为更好地利用不同排序步骤间的相关性,本文提出使用强化学习(RL)来学习一种最优排序策略,以最大化搜索会话中的期望累积奖励。首先,我们正式定义了搜索会话马尔可夫决策过程(SSMDP)的概念以形式化该多步排序问题。其次,我们分析了 SSMDP 的性质,并从理论上证明了最大化累积奖励的必要性。最后,我们提出了一种新颖的策略梯度算法用于学习最优排序策略,该算法能够处理 SSMDP 的高奖励方差与奖励分布不均衡问题。实验在仿真环境与淘宝搜索引擎中进行。结果表明,我们的算法表现远优于在线 LTR 方法,在仿真与实际应用中总交易额分别增长了超过 40% 与 30%。
引用
@article{arxiv.1803.00710,
title = {Reinforcement Learning to Rank in E-Commerce Search Engine: Formalization, Analysis, and Application},
author = {Yujing Hu and Qing Da and Anxiang Zeng and Yang Yu and Yinghui Xu},
journal= {arXiv preprint arXiv:1803.00710},
year = {2018}
}