请求级推荐中的未来影响分解
信息检索
2024-06-19 v5
摘要
在推荐系统中,强化学习解决方案在优化用户与系统之间的交互序列以实现长期性能方面显示出有前景的结果。出于实际原因,策略的动作通常设计为推荐一个项目列表,以更有效地处理用户频繁且持续的浏览请求。在这种列表推荐场景中,用户状态在相应的MDP公式中每次请求时更新。然而,这种请求级公式本质上与用户的项目级行为不一致。在本研究中,我们证明即使在请求级MDP下,项目级优化方法也能更好地利用项目特征并优化策略性能。我们通过比较标准请求级方法与所提出的项目级演员-评论家框架在模拟和在线实验中的性能来支持这一主张。此外,我们展示了基于奖励的未来分解策略可以更好地表达项目级未来影响并长期提高推荐准确性。为了更深入地理解分解策略,我们提出了一种基于模型的对抗学习重加权框架,进一步提升了性能,并研究了其与基于奖励策略的相关性。
引用
@article{arxiv.2401.16108,
title = {Future Impact Decomposition in Request-level Recommendations},
author = {Xiaobei Wang and Shuchang Liu and Xueliang Wang and Qingpeng Cai and Lantao Hu and Han Li and Peng Jiang and Kun Gai and Guangming Xie},
journal= {arXiv preprint arXiv:2401.16108},
year = {2024}
}
备注
12 pages, 8 figures