基于 Decision Transformer 的用户留存导向推荐
信息检索
2023-03-14 v1
摘要
利用强化学习(RL)改善用户留存因其在提升用户参与度方面的重要意义而受到越来越多的关注。然而,由于需要试错搜索,在不损害用户体验的情况下从零训练 RL 策略是不可避免的。此外,旨在无需在线交互即可优化策略的离线方法,面临着值估计中臭名昭著的稳定性和反事实策略评估中无界方差的问题。为此,我们提出利用 Decision Transformer(DT)优化用户留存,其通过将 RL 转化为自回归问题来避免离线困难。然而,在推荐中部署 DT 是一个非平凡的问题,原因如下挑战:(1)对数值奖励值建模的不足;(2)策略学习与推荐生成之间的数据差异;(3)不可靠的离线性能评估。因此,在本工作中,我们提出了一系列策略来解决上述暴露的问题。我们首先通过元嵌入的加权聚合阐明一种高效的奖励提示,以获得信息丰富的奖励嵌入。然后,我们赋予一种加权对比学习方法来解决训练与推理之间的差异。此外,我们设计了两个鲁棒的离线指标来衡量用户留存。最后,在基准数据集上的显著提升证明了所提方法的优越性。
引用
@article{arxiv.2303.06347,
title = {User Retention-oriented Recommendation with Decision Transformer},
author = {Kesen Zhao and Lixin Zou and Xiangyu Zhao and Maolin Wang and Dawei yin},
journal= {arXiv preprint arXiv:2303.06347},
year = {2023}
}
备注
9 pages, 5 figures