基于二维网格推荐面板的强化重排序方法
信息检索
2023-11-13 v3
摘要
现代推荐系统通常将物品以流式一维排序列表呈现。近来电子商务中出现一种趋势,即将推荐物品组织为具有两个维度的基于网格的面板,用户可沿垂直与水平方向浏览物品。以基于网格的结果面板呈现物品给推荐系统带来新挑战,因为现有模型均设计用于输出序列列表,而网格面板中的槽位无显式顺序。直接将物品排序转换为网格(例如预先定义槽位顺序)忽视了用户在网格面板上的特定行为模式,并不可避免地损害用户体验。为解决该问题,我们提出一种新颖的马尔可夫决策过程(MDP),在推荐系统的最终重排序阶段将物品放置于二维网格结果面板中。该模型称为 Panel-MDP,以早期阶段给出的初始物品排名为输入。随后,其将 MDP 离散时间步定义为初始排名列表中的名次,并将动作定义为用户-物品偏好预测与槽位选择。在每个时间步,Panel-MDP 顺序执行两个子动作:首先判定初始排名列表中的当前物品是否被用户偏好;若偏好则为该物品选择槽位放置,否则跳过该物品。该过程持续直至所有面板槽位被填满。采用 PPO 强化学习算法实现并学习 Panel-MDP 中的参数。基于某广泛使用电商应用收集数据集的仿真与实验证明了 Panel-MDP 在推荐二维网格结果面板方面的优越性。
引用
@article{arxiv.2204.04954,
title = {Reinforcement Re-ranking with 2D Grid-based Recommendation Panels},
author = {Sirui Chen and Xiao Zhang and Xu Chen and Zhiyu Li and Yuan Wang and Quan Lin and Jun Xu},
journal= {arXiv preprint arXiv:2204.04954},
year = {2023}
}